【AIニュース】推論ベンチマークの信頼性問題とエージェント安全性の最前線ベンチマーク汚染への対抗策となるMathArena、エージェント攻撃耐性の評価フレームワーク、Scale AIの国防契約、Microsoftの小型推論モデルPhi-4を取り上げる。
【AIニュース】オープンウェイトの“コーディングエージェント化”と、根拠ある推論の訓練が主戦場にオープンウェイトLLMがコーディングエージェントとしての実用域に入りつつある一方で、推論の“それっぽさ”を排し、根拠に基づく意思決定をどう学習させるかが研究の焦点になっています。