allenai が olmo-eval: An evaluation workbench for the model development loop をリリース ── LLM開発の評価ループを劇的に効率化
Ai2がLLM開発の評価ループを効率化するツール「olmo-eval」を公開。エージェント評価をサポートし、プロンプト単位で詳細な分析が可能。
Ai2がLLM開発の評価ループを効率化するツール「olmo-eval」を公開。エージェント評価をサポートし、プロンプト単位で詳細な分析が可能。
MiniMaxが約428Bパラメータのオープンソースモデル「MiniMax-M3」を公開。独自の疎注意機構で100万コンテキストの処理を劇的に高速化。
MiniMaxが約428BパラメータのネイティブマルチモーダルモデルMiniMax-M3-MXFP8をリリース。独自のスパースアテンションで100万コンテキストを高速処理。
Moonshot AIがコーディング特化モデル「Kimi K2.7 Code」をリリース。総パラメータ1TのMoEで思考トークンを約30%削減し、謎のGPT-5.5と比較。
Hugging FaceがPyTorchプロファイリング解説の第2弾を公開。nn.LinearからFused MLPまで、A100 GPUを使った実践的な最適化手法を深く掘り下げる。
天体物理学者がOpenAIのCodexを活用してブラックホールのシミュレーションを構築。アインシュタインの一般相対性理論の検証など、極限の物理研究を支援する事例が公開された。
Google DeepMindがテキスト拡散モデルDiffusionGemmaをリリース。H100で1000+ tokens/secを叩き出す超高速モデル。
NotionがCodexで仕様書のワンショット生成、Web用AI音声入力構築、小規模チームの生産性向上を実現した事例を紹介。
GitHub ActionsのジョブをHugging Face Jobsで実行し、GPUテストを可能にしつつCPUジョブを約30%高速化する手法を紹介。
NextdoorのエンジニアがCodexとGPT-5.5を活用し、再現困難なバグ調査を効率化。マルチプラットフォーム開発で成果に集中する事例。