まとめ検索.com

AIに何回ダメ出ししたかを測る、対話型ベンチSWE-Together

zenn · 2026-07-26

この記事で分かること

AIとの対話における「ダメ出し(修正指示)」の回数を計測するベンチマークSWE-Togetherを紹介している。読者は、このベンチマークを用いて、AIエージェントの応答品質や対話効率を定量的に評価できる。具体的な測定方法と、スコアが低い場合の改善方針が得られる。

詳細要約

AIの出力に対し人間が何回修正指示を出す必要があるかで性能を評価する対話型ベンチマーク。ソフトウェアエンジニアリングタスクで、モデルが一度で正しい回答を出せるか、何度のやり取りで完了するかを測る指標として使う。具体的には、コード生成時に人間が「ここを直して」とフィードバックした回数をカウントし、少ないほど初期品質が高いと判断する。複数のAIモデルを比較する際の判断材料にでき、チューニングの目標値設定にも役立つ。

関連ニュース