cs.LG updates on arXiv.org
・モデルとハーネスの共進化を前提に、推論時の補助機構であるハーネスを将来の学習データ生成源として最適化する「Harness-in-the-loop learning」の重要性を提起
・提案手法RHIは、エージェントループをプロンプトレベルで記述したハーネスを、過去の改訂履歴に対するペアワイズ評価で反復改善し、少ない更新回数・低計算コストで実行トレース品質を向上
・金融・ロボティクス・薬学の30種の合成ML研究タスクで、低推論コスト設定でも性能上限を大きく引き上げ、最大推論設定を上回りつつ最大60%の推論コスト削減を達成した
Action: 自社のエージェント基盤で使っているプロンプト型ハーネスを版管理し、実行トレースの品質指標とタスク成功率を比較するペアワイズ評価ループを試作して、少数回の自動改善で性能とコストがどう変わるか検証する