跳到正文
原文
arXiv cs.AI· Andre Fu, Malik Drabla, Leon Liu, Meji Abidoye, Marek Suppa, Lata Mishra, Adnan El Assadi, Yiyuan Li·· 4 小时前AI 评分38

Incident-Arena:让 AI 智能体达到可靠性的最后九分

Incident-Arena: Getting agents to the last nine of reliability

AI 导读

Incident-Arena 是面向 agentic SRE 的人工构建基准,含 20 个基于真实部署开源软件的任务,每个任务把生产应用部署到临时 Kubernetes 集群并从配置层注入故障。前沿模型在 20 个任务、3 种应用基底上得分均低于 64.3%,失败涵盖诊断与定位错误、修复不完整和不安全回归。智能体单次试验平均消耗 2.81M tokens、41 轮,用于检验长程推理能力。

来源:arXiv cs.AI · arxiv.org