跳到正文
热点事件持续更新

micro1发布PersonalAgentBench基准

2 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026年10月6日,micro1 发布 PersonalAgentBench 基准测试,专测个人 AI 助手在订机票、回邮件、调整日程等真实日常任务中的表现与可信度,并强调个人 Agent 的能力并不等于可信;测试对象包括 Instinct、Muse、Grok Bot 和 Gemini Spark。同日公布的初步榜单显示,Gemini Spark 在四款助手的横评中暂时领先。该基准覆盖十类日常任务,例如给团队写备忘、搜航班、找最低价,由专家按任务完成度和行为是否可信两项指标打分。micro1 官网提供各 agent 的对话记录供对比查看,并称会持续收集公开任务、动态更新结果,因此榜单排名可能随测试推进而变化。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月6日
  1. AGI Hunt
    micro1 PersonalAgentBench 初步榜单:Gemini Spark 领跑四款助手横评

    micro1 的 PersonalAgentBench 公布初步结果:Gemini Spark 暂时领先,对比对象还包括 Grok Bot、Instinct 和 Muse。该基准测试十类日常任务(如给团队写备忘、搜航班、找最低价),专家按任务完成度和行为是否可信打分,官网提供各 agent 对话记录对比,并持续收集公开任务、动态更新结果。

  2. AGI Hunt
    micro1 发布 PersonalAgentBench:个人 Agent 能力不等于可信

    micro1 推出 PersonalAgentBench,专测个人 AI 助手在订机票、回邮件、调整日程等真实日常任务中的表现与可信度,测试对象含 Instinct、Muse、Grok Bot 和 Gemini Spark。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。