腾讯(Tencent)

腾讯是中国头部互联网公司,在 AI 领域以「自研 + 开源」双线推进:既有对标 Claude Code 的编程工具 CodeBuddy,也开源了图像模型 Nano Banana、0.3B 端侧小模型等,覆盖云端到端侧的完整谱系。

编程与 Agent 方面,腾讯 CodeBuddy Code 对标 Claude Code 显示其切入 AI 编程 赛道。开源与多模态方面,腾讯开源 Nano Banana腾讯开源 0.3B 端侧模型 体现其在图像生成与 端侧 AI 的布局。产品创新上,腾讯“马维斯” 反映其持续推出新 AI 产品。整体见 中国 AI 生态

[2026-08-10] 一周开源两个 Agent 评测基准:WorkBuddy Bench 与 E-Bench

2026 年 7 月,腾讯一周内公开两篇 Agent 评测论文(合计 583 题),把内部选模型的方法论开放出来(来源:腾讯 Agent 评测):

  • WorkBuddy Bench(7/24,arXiv 2607.20911,编码助手 WorkBuddy 团队 + 安全实验室):写代码 / 前端 / 办公文件 / 安全审计四赛道共 260 题,题目、评分代码、参考答案全部开源;题目从真实代码提交记录、代码审查请求、安全漏洞逆向改写成口语化需求,改写后反查搜索引擎确认搜不到原始出处,从出题方式上防”背题”;全程确定性程序打分。详见 WorkBuddy-Bench
  • E-Bench(7/28,arXiv 2607.23722,混元团队):王者荣耀 / QQ 音乐 / 腾讯会议三个真实产品场景合成 323 道有状态多步工具调用任务,同时统计 Pass³ 可靠性与 API 成本。详见 E-Bench

核心结论:没有一个前沿模型能通吃所有场景,评测结果高度依赖执行环境与任务形态——Agent 选型已进入”场景化选模型”阶段。见 Agent 评测基准AI Agent EvaluationAgent 评测范式演变

关联