LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge カバー画像

Hugging Face が LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge を公開 ── 34Tトークンで鍛えたエッジ推論の新基準

HUGGING FACE

最終更新: 2026年08月14日 21:10 元記事 →

LiquidAIが開発した新しいビジョン言語モデル「LFM2.5-VL-3B」が、その名の通り「より速く、より良く」なっています。エッジデバイスでのリアルタイム処理を念頭に置いた設計は、単なる小型化ではなく、ドキュメントやUIの理解精度を大幅に引き上げるもの。これはかなり興味深い方向性です。

何が変わったのか

LFM2.5-VL-3B(3.1Bパラメータ)は、SigLIP2 400M NaFlexビジョンエンコーダーとLFM2.5-2.6Bのバックボーンを組み合わせたモデルです。学習データは約34Tトークン、そのうち画像関連が従来比4倍に増強されました。特徴的なのは、ラテン文字以外のサポートのため、ゼロから再トレーニングせずトークナイザーを拡張して128Kの語彙サイズを実現した点。ポストトレーニングでは教師モデルからの知識蒸留やAntidoom学習、マルチリワード強化学習(RL)が施されています。

前モデル / 競合との比較

ベンチマークを見ると、LFM2.5-VL-3Bは同サイズクラスで実世界の画像タスクをリードしています。例えばMMStarでは63.3点を記録(前モデルの57.7から改善)、MMBench (dev EN v1.1) では81.0点と競合のInternVL 3.5 4B(81.1点)に迫る高性能を示しました。一方、Qwen3.5-4Bやgemma-4-E4B-itなどより大きいモデルと比較しても、特にマルチリンガルなMMMBで83.0点と好成績を収めており、スケーラビリティの高さがうかがえます。

技術背景と意義

従来の大規模モデルは計算コストが高く、端末上で動かすのが難しい面がありました。このモデルは「推論のための reasoning(思考プロセス)」を省略し、直接答えを出すことで速度とレイテンシーを最適化しています。また、画面(Screen)の理解や物体検出(Grounding)、複数画像の統合的な解釈能力を高めたことで、アプリ内でのUI操作支援やドキュメント解析といった実務用途への適性が高まっています。

こんな人・用途に

[‘スマートグラスやスマートフォンなどの端末上で、リアルタイムの画面情報をテキストに変換・分析するアプリ開発’, ‘限られたメモリ環境下で、複数ページにまたがるドキュメントの要約やチャート読み取りを行う業務ツール’, ‘物体認識と自然言語クエリを組み合わせた、直感的な検索や指示出しが可能なスマートデバイス’]

Hacker Newsの反応

開発者本人が登場してQ&Aを受け付けるという、非常に誠実で静かな反応ですね。

Hacker News

「Liquid AIでこのモデルの開発に関わっていた者です。質問や議論があれば、いつでもここに顔を出して回答します。」

u/samstevens

入手方法・リンク

LFM2.5-VL-3BはLiquidAIによって提供されていますが、Hugging Face上のアーティクルや関連ページからアクセス可能です。具体的なGitHubリンクや詳細なダウンロードパスについては、提供テキスト内に記載されていませんので、LiquidAIの公式リポジトリまたはHugging Face Hubでの公開情報を確認する必要があります。

SOURCE: Hugging Face (2026-08-14)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です