Qwen3.8-2.4T-A95B カバー画像

Alibaba (Qwen) が Qwen3.8-2.4T-A95B を投入 ── Max級モデルがオープンソース化

ALIBABA (QWEN)OSS

最終更新: 2026年08月15日 16:07 元記事 →

ついに「Max」クラスの性能を持つモデルが、オープンソースとして解放された。AlibabaのQwenチームによる今回の発表は、エンタープライズ向けの閉鎖的モデルとオープンモデルの境界線を大きく揺るがす内容だ。2.4兆パラメータという巨大な規模でありながら、950億パラメータのみを活性化させる設計が採用されている。

何が変わったのか

Qwen3.8シリーズでは、初めてQwen-Maxクラスのモデルがオープンリリースされた点が最大のトピックだ。総パラメータ数は2.4T(2兆4000億)だが、推論時には95B(950億)しか動かないハイブリッド構成を採用している。アーキテクチャはGated DeltaNetとGated Attentionを組み合わせ、MoE(Mixture of Experts)では512個のエクスパートの中から10個ルーティング+1個共有で処理を行う。コンテキスト長はネイティブで262,144トークン、最大で約100万トークンまで拡張可能だ。また、reasoning_effortやpreserve_thinkingといった推論深度の制御機能も実装されている。

前モデル / 競合との比較

提供されたベンチマーク結果によると、Qwen3.8-Max(ベースモデルは今回公開のQwen3.8-2.4T-A95B)はTerminal Bench 2.1で86.6点、SWE-bench Proで67.7点を記録している。これにより、従来のQwen3.7-Max(Terminal Bench 74.5点、SWE-bench Pro 60.6点)から大幅な性能向上が見られる。競合他社モデルとの比較では、Opus 4.8やFable 5などと同程度のスコア圏内にあり、特にコーディングエージェント領域での競争力が際立っている。

技術背景と意義

簡単に言うと、巨大な辞書(全パラメータ)を持っていながら、質問の内容によって必要なページだけを開いて答える仕組みだ。Gated DeltaNetという線形アテンション機構と、通常の自己アテンションを層ごとに交互に配置することで、長文脈の処理効率と精度の両立を図っている。MoE(混合エキスパート)技術により、計算資源を特定のタスクやトークンに集中させるため、2.4Tという巨大モデルでありながら実運用でのコストを抑えつつ、Max級のパフォーマンスを引き出しているのが特徴だ。

こんな人・用途に

・コーディングエージェントの構築:Terminal Bench 2.1で86.6点を記録し、複雑なマルチステップタスクを自律的に完遂する能力が期待できる。
・長期推論エージェントの開発:環境フィードバックに対する処理能力が強化されており、信頼性の高いエンドツーエンドのタスク完了が可能。
・既存スタックへの統合:vLLM、SGLang、TokenSpeedなどの人気ハーネスや開発ツールとの互換性が確保されている。

Hacker Newsの反応

「Qwen-Maxクラスがオープンウェイトになる」というニュースに、Hacker Newsでは驚きと興奮が走っている。巨大モデルの実用性やコスト構造への疑問も交じりつつ、技術者たちの期待感が高まっている空気だ。

Hacker News

「1bit量子化で397GB、アクティブ95Bというサイズはすごい。普通の人が買えるマシンでOpus 4.5相当のパフォーマンスが出るとしたら、これはかなりやばい展開だ。」

u/guardiangod
Hacker News

「ついにQwen-Maxクラスのモデルがオープンソースされるのか。これまでクローズドだった最高峰モデルの重みが公開されるのは、コミュニティにとって大きな転換点になるだろう。」

u/simonw
Hacker News

「オープンウェイトなのに、なぜGPT5.6とほぼ同じ価格帯なの? 自分でハードウェアを用意して運用するメリットが薄れているなら、この料金設定は少し疑問だ。」

u/drnick1
Hacker News

「Qwen 3.8の27B版を待ち望んでいた。ストリックス・ハローでのプリフィル速度は遅いが、エージェントタスク向けのモデルとして非常に優秀だと感じている。」

u/syntaxing
Hacker News

「エージェント指数で「ベスト」とされているのに、Artificial AnalysisのページにはQwenへの言及がない。ランキングと実際のデータ表示に齟齬があるのは奇妙だ。」

u/embedding-shape

入手方法・リンク

モデルウェイトと設定ファイルはHugging FaceのTransformers形式で公開されている。vLLM、SGLang、TokenSpeedなどの推論フレームワークと互換性があるため、これらのツールを使ってローカルまたはセルフホスト環境でのデプロイが可能だ。また、インフラ管理なしでスケーラブルな推論を行いたい場合は、Qwen Cloudが提供する公式APIサービス(Qwen3.8-Max)の利用も選択肢に入る。

SOURCE: Alibaba (Qwen) (2026-08-08)

← LLM Watch トップへ

類似投稿

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です