Hugging Face が Up to 3.2x Faster Inference with LFM2.5-DSpark を発表 ── 推論速度を劇的に改善する新アーキテクチャ
LiquidAIが公開したLFM2.5シリーズに、推論速度向上を狙う新しい「DSpark」ドラフトモデルが加わった。GPU上では最大3.18倍の_throughput_向上を実現し、デバイス上でも約2.9倍の高速化だ。出力品質を落とさずにこのスピードアップを達成した理由は、従来の推論ボトルネックへの徹底したアプローチにある。
▸何が変わったのか
LiquidAIはLFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1Bの3モデル向けにDSparkドラフトチェックポイントを提供している。最大のポイントは、推論速度の大幅向上だ。GPU環境では最大3.18倍の_throughput_改善、オンデバイス環境でも2.87倍の高速化を実現した。特に注目すべきは、LFM2.5-2.6Bにおける関数呼び出し(function-calling)のレイテンシーが平均57%短縮された点だ。これにより、エージェント型AIの実用性が一段と高まったと言える。
◈前モデル / 競合との比較
既存のEAGLE-3やDFlashといった予測デコーディング手法と比較し、DSparkは並列バックボーンとシークエンシャルヘッドを組み合わせることで、特に後方のトークン位置における受容率(acceptance rate)の向上に成功している。また、各ドラフトモデルのパラメータ数は約300M程度と軽量に設計され、メモリ増加を最小限に抑えつつ大きな速度向上を実現している点が特徴だ。
◈技術背景と意義
LLMの推論で遅くなる主な原因は、計算そのものではなく、メモリ(DRAM)から演算ユニット(SRAM)へのデータ転送にある。これを解決するのが「予測デコーディング」だ。DSparkは、ターゲットモデルの文脈特徴に基づいて隠れ状態を生成する並列バックボーンと、隣接トークン間の依存関係を考慮したシークエンシャルヘッド、そして確信度に基づいて不要な計算を剪定する検証器という3つの要素を組み合わせている。これにより、複数の候補トークンを一度に処理し、メモリ読み込みコストを分散させているのだ。
▸こんな人・用途に
[‘関数呼び出しのレスポンス速度が重要なエージェント型AIアプリケーション’, ‘オンデバイス環境でのリアルタイム推論が求められるエッジケース’, ‘推論コストを抑えつつ高速な応答が必要なチャットボット’]
◆入手方法・リンク
LFM2.5シリーズのドラフトモデルチェックポイントはLiquidAIから提供されている。また、LFM互換のDSpark統合部分はupstreamにオープンソースとして公開されており、llama.cppやSGLangで即日サポートが開始されている。詳細はLiquidAIの公式サイトまたは関連技術記事にて確認できる。
▸Redditの反応
スコア7、コメント0とまだ議論が沸騰していない段階ですが、H100からMacへの高速推論というタイトル自体には技術的な興味を引かれている様子です。
SOURCE: Hugging Face (2026-08-20)
