Skip to contentベンチマーク汚染への対抗策となるMathArena、エージェント攻撃耐性の評価フレームワーク、Scale AIの国防契約、Microsoftの小型推論モデルPhi-4を取り上げる。
エージェントの世界理解(world modeling)の整理が進む一方、運用コスト(トークン消費)と推論表現(潜在CoT)の最適化が実務課題として前面に出てきました。研究の枠組みが、そのままプロダクト運用の設計図になりつつあります。
オープンウェイトLLMがコーディングエージェントとしての実用域に入りつつある一方で、推論の“それっぽさ”を排し、根拠に基づく意思決定をどう学習させるかが研究の焦点になっています。