Skip to content
TopicTracker
出典 HackerNews原文を表示
翻訳言語翻訳言語

Reap: コーディングエージェントベンチマークの自動キュレーション

本論文では、コーディングエージェントの性能評価に用いるベンチマークを自動的にキュレーションする手法「Reap」を提案する。手動でのベンチマーク構築は時間とコストがかかる問題に対し、Reapはコードリポジトリから自動的にタスクを抽出・選別することで、多様で質の高い評価データセットを効率的に生成する。

背景メモ

- **Reap** は、コード生成AIエージェントのベンチマーク(性能評価用問題集)を自動で作成・管理する新しいフレームワーク。従来は手作業でのキュレーションが主流だった。 - コードエージェント向け既存ベンチマーク(SWE-bench, HumanEvalなど)は、問題のリーク(訓練データに回答が混入)や重複、品質劣化といった課題を抱えており、Reapはこれらを自動検出・除去する仕組みを提供する。 - arxivの論文プレプリントで、査読前だが主要AI研究所(OpenAI, Anthropic, Google DeepMind, Metaなど)から注目を集めている分野の研究。 - コーディングエージェント(与えられた課題を自律的にコードを書いて解決するAI)の信頼性評価は急成長中のテーマ。Reapのような自動キュレーション手法は、評価の公平性と持続可能性を高める鍵とみなされている。 - 著者らは、Reapを用いて既存ベンチマーク中の問題点を発見し、より正確な評価が可能になることを示した。

関連記事