AIがAIを採点すると、同じところで間違える。AgentJudgeBenchが示した評価の落とし穴
6種類の採点AIを集めても、難しいツール呼び出しでは同じ盲点…
6種類の採点AIを集めても、難しいツール呼び出しでは同じ盲点…
質問すれば78.8%答えられるのに、自然な会話で事実に触れた…
2,269件の実PRで、AIの欠陥検出F1は最高でも0.55…
大型モデルには圧縮文脈、小型モデルには完全文脈。AsymSp…
安いモデルから高性能モデルへ替えても、生の履歴を渡すだけでは…
テストが全部通っても、古い技術が残れば移行は未完です。20件…
本番のIssueを待たず、テストから練習問題を作るSkill…
1,140件の長い失敗軌跡を集めたLongRCA Bench…
10の研究コードをAIエージェントに改善させたAI4AI-B…
公開テストでは96.64%でも完全成功は47.90%。119…