Hugging Face が ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration をリリース ── エンタープライズJava移行を試す超実践ベンチマーク
エンタープライズJavaのフレームワーク移行を評価するScarfBenchが登場。ビルドからデプロイまでAIエージェントがこなせるかを測る、超実践的な新ベンチマーク。
エンタープライズJavaのフレームワーク移行を評価するScarfBenchが登場。ビルドからデプロイまでAIエージェントがこなせるかを測る、超実践的な新ベンチマーク。
OpenAIがゲノム・生物学向けの新ベンチマーク「GeneBench-Pro」を発表。複雑な現実世界のデータでAIを試す。
Google DeepMindが、4秒で画像生成&1K枚0.034ドルの「Nano Banana 2 Lite」と動画編集モデル「Gemini Omni Flash」をリリース。
OpenAIのエンジニアが大規模なコアダンプ解析を実施し、インフラクラッシュの原因となっていたハードウェア障害と18年間眠っていたバグを特定した。
万能なAIより特化型が勝る理由を数学や生物学から紐解く、Dharma AIチームによるHugging Faceの注目考察記事。
万能な汎用AIは幻想? 最適化理論と進化生物学が示唆する、特化型AIの圧倒的優位性と今後の展望をDharma-AIが鋭く解説。
Hugging Faceがベンチマーク評価の標準化プロジェクトEEEとCommunity Evalsを連携。約22万件の評価結果を統一フォーマットでモデルページに統合。
1つのTransformerでデータの密度とスコアを同時推定し、再学習なしで未知データにも適応するDiScoFormerを解説。
DeepSeekがV4シリーズをプレビュー公開。100万トークン対応で計算量を27%、KVキャッシュを10%に削減し、圧倒的な長文処理効率を実現。
DeepSeekが「DeepSeek-V4」をリリース。1兆6000億パラメータでありながら、100万トークン処理時の計算コストを劇的に削減することに成功した超効率MoEモデル。