Hugging Face が Is it agentic enough? Benchmarking open models on your own tooling をリリース ── AIエージェントが使いやすいライブラリ設計とは?
Hugging Faceが提案する、AIエージェントが使いやすいソフトウェア設計。答えだけでなくプロセス全体を評価する新しいベンチマーク手法を解説。
Hugging Faceが提案する、AIエージェントが使いやすいソフトウェア設計。答えだけでなくプロセス全体を評価する新しいベンチマーク手法を解説。
エージェントが実行時に必要なツールや他エージェントを自ら検索・発見する新オープン標準「ARD」をHugging Faceらが発表。
Allen AIが公開したMolmoMotionは、テキスト指示と3Dポイントから未来のモーションを予測する新しいモデル。116万本規模のデータセットも同時リリース。
AWS Strands Robots SDKとLeRobotが統合。Hubのデータセットから実機SO-101まで、ひとつのエージェントで完結するロボット開発パイプライン。
GLM-5.2が100万トークンのコンテキストを安定処理。長期タスク能力でOpusやGPT-5.5に肉薄する驚異のモデル。
Ai2がLLM開発の評価ループを効率化するツール「olmo-eval」を公開。エージェント評価をサポートし、プロンプト単位で詳細な分析が可能。
Hugging FaceがPyTorchプロファイリング解説の第2弾を公開。nn.LinearからFused MLPまで、A100 GPUを使った実践的な最適化手法を深く掘り下げる。
GitHub ActionsのジョブをHugging Face Jobsで実行し、GPUテストを可能にしつつCPUジョブを約30%高速化する手法を紹介。
Cohereがリリースしたコーディング特化モデル「North Mini Code」。3Bのアクティブパラメータで120B超えのモデルを凌駕する驚異の性能を実現。
Hugging Faceブログで、バイリンガルの自然な会話におけるASR精度を競う新ベンチマークが公開。ElevenLabsやGeminiらがトップに。