Alibaba (Qwen) が Qwen3-1.7B-Base-W32K-L0_100 を発表 ── LLMのブラックボックスを解き明かすSAEモジュール
AlibabaがLLMの内部挙動を解読するための解釈可能性モジュール「Qwen-Scope」を公開。TopK SAEを用いてモデルの思考を可視化。
AlibabaがLLMの内部挙動を解読するための解釈可能性モジュール「Qwen-Scope」を公開。TopK SAEを用いてモデルの思考を可視化。
AlibabaがQwen3-30B-A3B向けSAE「Qwen-Scope」を公開。131,072次元のスパース特徴でLLM内部を解読する試み。
アリババがQwen3.5用のSAE解釈モジュール「Qwen-Scope」をリリース。全40層対応、TopK=100のSparse Autoencoderでモデル内部を解析可能。
OpenAIがGPT-5の振る舞いに現れる「ゴブリン出力」の発生原因と修正プロセスについて解説。
OpenAIがAGI実現に向けコンピュートインフラ「Stargate」を大規模展開。データセンター容量を追加しAI需要に対応する体制構築へ。
Hugging FaceがDeepInfraをInference Providerとして追加。100超モデルが最安値クラスで使えるサーバーレス推論環境
Hugging Faceが警告、AI評価コストが許容範囲を超える。エージェント評価で数万ドル、モデル開発のコストを超す可能性も。
Mistralの最新統合モデル「Mistral Medium 3.5」が登場。128Bパラメータ、256kコンテキスト、画像対応。
IBMのGranite 4.1は15Tトークンで学習した3B〜30BのLLM。8Bモデルが前世代の32Bモデルを凌駕。最大512Kトークンの長文コンテキストに対応。
Tencentが超軽量翻訳モデル「Hy-MT1.5-1.8B-1.25bit」をリリース。440MBでスマホオフライン動作可能な驚異的な1.25ビット量子化を実現。