OpenAI が GPT-6 を投入 ── 法務業務の「面倒な対照」を数分で処理

OPENAI

最終更新: 2026年09月10日 06:35 元記事 →

「一晩、あるいは数日かかる」法務業務の根幹をなす数字の照合が、たったの数分で終わる。OpenAIの最新モデル「GPT-6 Astra」を使った実証実験の報告が公開され、その処理速度と精度の向上ぶりには正直、少し驚かされた。これは単なるデモではなく、実務で使われるドキュメント41件を対象にしたものだ。

何が変わったのか

欧州のスタートアップ企業Legoraが、GPT-6 Astraを用いて財務諸表の「タイアウト(対照検証)」を自動化した。この作業は本来、試算表や連結スケジュール、前年度会計との項目ごとに一致を確認する極めて手間のかかる作業で、Legoraの法務エンジニアであるPercevale Perks氏は「一晩、時には数日かかる」と説明している。しかし今回のテストでは、Agent単体の実行で41件の文書処理を数分で完了させた。さらに、Legoraが意図的に仕込んだ4つのエラー(売上注記に隠れた50万ポンドのギャップを含む)をすべて検出し、前モデルが正解した項目も維持しつつ、約50項目以上の追加チェックも実行している。Legora独自の評価ベンチマーク「BAR」では、この財務諸表ワークフローにおいて前モデルから約40%の性能向上を確認している。

前モデル / 競合との比較

GPT-6 Astraは、Legoraが設定した財務諸表ワークフローにおいて、前モデルと比較して約40%の性能向上を示した。また、意図的に仕込まれたエラー4件中4件を検出でき、前モデルが正解した項目を維持しつつ約50項目の追加チェックを行った。全体的なBARベンチマークでは約3%の平均向上となっている。

技術背景と意義

GPT-6 Astraの強みは、大量かつ複雑な文脈を一度に読み込み、異なる行項目や数字を正確に結びつける「処理能力」にある。従来のAIが文書の要約や単一の質問に答えるだけだったのに対し、今回のエージェントは「すべての残高を補足的なスケジュールと比較し、不一致があれば浮き彫りにし、各チェックを記録する」という多段階の論理処理を自律的に遂行した。つまり、単純なパターンマッチングではなく、文書の構造と意味を理解した上で、網羅的な検証を行うことが可能になった点を示している。

こんな人・用途に

・大手法律事務所や社内法務部門での契約書・覚書レビュー支援
・監査、税務、コンプライアンス、リスク管理分野での文書対照作業
・10万人以上の専門家が利用するLegoraプラットフォームでのエンドツーエンドワークフロー自動化

Hacker Newsの反応

ARC-AGI-3での高スコアが話題を呼び、期待感と「本当にAGIなのか」という懐疑論が混在する、ややざわついた空気だ。

Hacker News

「ARC-AGI-3で98.6%という報告を見かけた。以前のFable時代が約30%だったので、かなり驚異的な伸び率だ。」

u/softwaredoug
Hacker News

「ついにProプランでも利用可能になった。リリースから24時間しかかかっていない。」

u/kingstnap
Hacker News

「このモデルのAzure版は、データが保管されないZDR(ゼロデータリテンション)対応になっているのか?」

u/r_lee
Hacker News

「次のモデル名は「galaxy」になるのだろうか。」

u/syumei
Hacker News

「AGIとか言わないでくれよ。」

u/qsera

入手方法・リンク

OpenAIのAPIを通じて利用可能。記事内には「Start building with OpenAI」という案内があり、API経由での導入を想定している。

Redditの反応

「GPT-6がループ型トランスフォーマーを使っている」という報道に対し、技術的な検証と実際の使い勝手への不信感が入り混じる。派手な驚きよりも、中身を追う冷静な議論が多い空気感だ。

Hacker News

「LLM内部構造に興味があるなら、Sebastianの記事は必読。要するに、The Informationが報じたGPT-6 Astraの「recurrent depth」や「looped transformer」の件について、かなり核心を突いている。」

u/libraryofbabel
Hacker News

「この記事は最新情報じゃないよ。OpenAIが公式に認めているベンチマーク結果など、いくつかのデータが更新されている。以下のスレッドのチャートを確認してほしい。」

u/cubefox
Hacker News

「少しズレてるかもしれないが、Astraはなんか不思議な感じ。信頼しにくいんだ。特にCodexでのトーンが嫌で、過剰に積極的な時があって、そこで離脱した。」

u/iJohnDoe

SOURCE: OpenAI (2026-09-07)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です