DeepSeek が DeepSeek-V4 をリリース ── 1兆6000億パラメータで100万トークンの処理コストを劇的に削減
DeepSeekが「DeepSeek-V4」をリリース。1兆6000億パラメータでありながら、100万トークン処理時の計算コストを劇的に削減することに成功した超効率MoEモデル。
DeepSeekが「DeepSeek-V4」をリリース。1兆6000億パラメータでありながら、100万トークン処理時の計算コストを劇的に削減することに成功した超効率MoEモデル。
Alibaba (Qwen)のQwen3-ASR-1.7B-hfリリース情報
Alibaba (Qwen)のQwen3-ASR-0.6B-hfリリース情報
Alibaba (Qwen)のQwen3-ForcedAligner-0.6B-hfリリース情報
Alibaba (Qwen)のQwen-AgentWorld-35B-A3Bリリース情報
Zhipu AIがGLM-5.2をMITライセンスで公開。1Mコンテキスト対応し、DeepSWEやFrontierSWEなどコーディング系ベンチマークが前モデルから大幅に向上。
Tencentがロボット操作AI「Hy-Embodied-0.5-VLA-UMI」を公開。1万時間超のデモデータ学習でRoboTwin 2.0ベンチマークSOTA達成。
TencentがVLAモデル「Hy-Embodied-0.5-VLA-RoboTwin」を公開。RoboTwin 2.0ベンチマークで成功率90%超を達成し、異なる実機ロボットへの転移にも成功。
MiniMaxが約428Bパラメータのオープンソースモデル「MiniMax-M3」を公開。独自の疎注意機構で100万コンテキストの処理を劇的に高速化。
MiniMaxが約428BパラメータのネイティブマルチモーダルモデルMiniMax-M3-MXFP8をリリース。独自のスパースアテンションで100万コンテキストを高速処理。