EVIE-8B カバー画像

Tencent が EVIE-8B を公開 ── 画像ドキュメント検索の精度を再定義

TENCENTOSS

最終更新: 2026年09月08日 06:33 元記事 →

「ドキュメント検索」って、ただテキストを拾うだけのものだと考えていませんか? Tencentが出したEVIE-8B、これはかなりやばい。表やグラフの構造まで理解して、視覚的な証拠に基づいて正確に「どのページか」を当ててくるんです。Hugging Faceで重さが解放された瞬間、この分野の空気感は確実に変わった。

何が変わったのか

最大のポイントは、画像内の表やタイポグラフィ、レイアウトのニュアンスまで保持した「トークン単位のマルチベクトル埋め込み」を採用していること。既存のモデルが情報を圧縮して失いがちな細部を、4096次元の表現空間で残している。ViDoRe V3のnDCG@10で66.75を記録し、業界最高の精度をマーク。さらに、軽量なEVIE-4.5Bを訓練するための教師モデルとしても機能し、蒸留レシピまでオープンソース化されています。

前モデル / 競合との比較

競合モデルであるwebAI-ColVec1.1-8bやVultronRetrieverPrime-8Bと比較すると、ViDoRe V3のnDCG@10においてEVIE-8Bが66.75と明確に上回っています。特にV2(74.23)からV3(66.75)への変遷でも、高難度タスクにおける安定した性能維持が見られます。軽量版のEVIE-4.5Bと比べても、わずか0.73ポイント差でありながら、より高度な推論能力と教師モデルとしての有用性を持ちます。

技術背景と意義

通常の検索モデルは、ドキュメント全体を一つのベクトル(数字の塊)に圧縮して比較します。でも、圧縮すれば情報も失われる。EVIE-8Bは、画像内の各トークン(部分)ごとにベクトルを持たせ、クエリとの一致度を「MaxSim」で計算する方式です。これにより、「この表の3行目と4行目の関係性」のような、局所的かつ視覚的な手がかりを逃さずに検索できる。双向(双方向)アテンション機構により、視覚情報とテキストプロンプトが深く相互作用し、文脈理解が飛躍的に向上しています。

こんな人・用途に

【企業内情報検索】契約書や技術文書、スキャン済みのPDFから、特定の表や図解を含むページを素早く特定したい場合。【学術研究】論文内の数式や実験結果のグラフを、テキストキーワードだけでは見つからない視覚的特征で検索する場合。【RAGシステム構築】画像が混在するコーパスに対して、文脈に忠実な検索レイヤーを構築したいエンジニア向け。

入手方法・リンク

モデルウェイトはHugging Faceの `Tencent/EVIE` リポジトリからダウンロード可能です。推論パイプラインや評価スイート、蒸留レシピを含むコード一式がGitHubの `Tencent/EVIE` にオープンソースで公開されています。

SOURCE: Tencent (2026-09-04)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です