新機能重要度 中
AWS が AI エージェント向けにオープンソースベンチマーク aws-bench を発表
AWS は AI エージェントが AWS タスクを正確かつ効率的に実行する能力を測定するベンチマーク aws-bench のリサーチプレビューを公開した。実世界の AWS 使用分析に基づくテストスイートで、モデルやエージェントの性能評価と改善に利用できる。
AWS は AI エージェントが実際の AWS タスクを正確かつ効率的に実行する能力を測定するためのオープンソースベンチマーク aws-bench のリサーチプレビューを発表した。このベンチマークは、調査、トラブルシューティング、インフラストラクチャ作成など、実世界の AWS 使用分析に基づくテストケーススイートを提供する。各テストケースは自然言語クエリと定義されたクラウドリソース状態、および正解をペアリングしており、任意のエージェントやモデルを一貫した検証可能な基準で評価できる。研究者やモデルプロバイダーは、aws-bench を利用して AWS タスクでのファウンデーション モデルの性能やエージェント ハーネスを改善し、進歩を追跡できる。リリースにはテスト環境のインスタンス化、評価の実行とスコアリング、リソース状態のリセットを行うための使いやすい CLI ツールも含まれる。aws-bench は現在 GitHub で利用可能で、README のセットアップ手順に従って始めることができる。