腾讯(Tencent)
腾讯是中国头部互联网公司,在 AI 领域以「自研 + 开源」双线推进:既有对标 Claude Code 的编程工具 CodeBuddy,也开源了图像模型 Nano Banana、0.3B 端侧小模型等,覆盖云端到端侧的完整谱系。
编程与 Agent 方面,腾讯 CodeBuddy Code 对标 Claude Code 显示其切入 AI 编程 赛道。开源与多模态方面,腾讯开源 Nano Banana 与 腾讯开源 0.3B 端侧模型 体现其在图像生成与 端侧 AI 的布局。产品创新上,腾讯“马维斯” 反映其持续推出新 AI 产品。整体见 中国 AI 生态。
[2026-08-10] 一周开源两个 Agent 评测基准:WorkBuddy Bench 与 E-Bench
2026 年 7 月,腾讯一周内公开两篇 Agent 评测论文(合计 583 题),把内部选模型的方法论开放出来(来源:腾讯 Agent 评测):
- WorkBuddy Bench(7/24,arXiv 2607.20911,编码助手 WorkBuddy 团队 + 安全实验室):写代码 / 前端 / 办公文件 / 安全审计四赛道共 260 题,题目、评分代码、参考答案全部开源;题目从真实代码提交记录、代码审查请求、安全漏洞逆向改写成口语化需求,改写后反查搜索引擎确认搜不到原始出处,从出题方式上防”背题”;全程确定性程序打分。详见 WorkBuddy-Bench。
- E-Bench(7/28,arXiv 2607.23722,混元团队):王者荣耀 / QQ 音乐 / 腾讯会议三个真实产品场景合成 323 道有状态多步工具调用任务,同时统计 Pass³ 可靠性与 API 成本。详见 E-Bench。
核心结论:没有一个前沿模型能通吃所有场景,评测结果高度依赖执行环境与任务形态——Agent 选型已进入”场景化选模型”阶段。见 Agent 评测基准、AI Agent Evaluation 与 Agent 评测范式演变。