9月1日·星期二 16:22·来源:InfoQ

AWS 发布 Aws-Bench,用于评估云任务中的智能代理

亚马逊云科技发布开源基准测试工具aws-bench,用于评估AI代理在真实AWS环境中的任务完成能力,覆盖配置错误诊断、基础设施配置及云环境运营等场景。与传统静态测试不同,该工具在一次性真实AWS账户中部署由CDK堆栈定义的资源场景,代理使用限定凭证在沙箱容器中执行任务,结果由LLM评判器或程序化状态检查自动评分。内置数据集包含基础与高级任务,涉及可观测性、计算、数据库、无服务器、流处理及多服务故障排除等用例。项目基于开源框架Harbor扩展,支持Claude Code、Codex、Kiro CLI及Mini-SWE-Agent等代理。运行需本地安装及组织管理账户权限,当前仅限us-east-1区域,并会创建持久化资源。发布暂未包含性能指标或标准化排行榜,均列入未来规划。该工具及数据集已以Apache-2.0许可在GitHub公开。发布正值业界对代理评估基准可靠性存疑之际,有研究指出部分基准测试易被利用而失真。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→