金融 AI

金融 AI 指 AI 在金融全链条的应用——投行工作流、金融 Skill、股市分析、模型厂商的金融布局等。它比量化交易(见 AI-Quant-Trading)口径更宽;AI 投研/投资视角见 wiki/topics/AI投资。当前呈现中美两条金融 Agent 落地路线。

美国路线:Anthropic 把投行工作流变成基础设施

Anthropic 推出 10 个可直接部署的金融 AI 代理模板(参考架构),每个模板包含技能、连接器和子代理三大核心组件,能对接机构现有数据、适配不同机构的建模惯例和风控政策。其战略并非单纯销售 AI 软件,而是打造接管金融工作流的基础设施——甚至联合黑石、高盛等机构成立 15 亿美元合资企业,向中型企业派驻 Claude 工程师推动 AI 深度嵌入业务流程。Anthropic 高管判断 AI 在金融领域的应用”仅比编程领域晚几个月”,而编程领域已出现数千岗位消失的大规模加速(wiki/sources/2026-05-11-太过颠覆!Anthropic刚推出一系列投行Agent工具,初级银行家就忍不住骂街了)。

更具说服力的是 Anthropic 自家财务团队(CFO 视角)的现身说法:用 Claude Cowork、Claude for Excel、Skills 协作处理”数据+叙事”双轮驱动的季度董事会 deck——真实痛点是数字到出稿当天早上还在刷新、每次刷新所有 commentary 都要重新对齐叙事。这是”我们自己每天就这样用”的第一视角,其经验在 Claude Code、Cursor、GitHub Copilot 里也能迁移(需把国外数据源换成国内版本)(wiki/sources/2026-05-31-Anthropic 亲自示范,如何使用金融Skills)。

中国路线:阿里云开源 100+ 金融 Skill

阿里云新金融团队发布《金融行业 Agent 百技图》——103 页实战手册,全量开源 100+ 金融 Skill(信贷审批到保险理赔),与 Anthropic 形成中美两条金融 Agent 落地路线。其判断是头部金融机构平均 AI 迭代周期压缩到 7 天、智能体部署量突破 2500+,但多数机构”搞错了层级”(wiki/sources/2026-06-01-阿里云103页手册把 100 多个金融 Skill 全量开源了)。

股市分析:桌面 Agent 与多智能体投研

Kimi 新发布的桌面 Agent 模式 Kimi Work(对标 Claude Cowork / OpenAI Codex)把股市分析作为重点场景:6 角色投研团队(研究员/基本面/技术/舆情/风险官/投资经理)并行 + 交叉验证,产出 Word/Excel/MD/风险清单/一页纸;可接同花顺/iFind/天眼查/Yahoo Finance 等专业数据源,Agent Swarm 单任务最多调度 300 个子 Agent 并行,并支持把反复用的股票分析 Prompt 封成 Skill(内置/市场/自定义三类)。不足是速度偏慢、缺 Plan 模式、长任务偶尔不稳定(wiki/sources/2026-06-19-Kimi 版 Codex 正式发布:股市分析给到夯!)。

模型层:金融成为下一个竞争最激烈的场景

MiniMax 在 Coding 之外重点押注金融。横测 MiniMax M3、DeepSeek V4 Pro、GPT 5.5 的三个真实投研 Case(互联网公司财报效率分析、巴菲特持仓研报、AI 产业链研究)显示 M3 表现稳健,多个 Case 排序 M3 > GPT 5.5 > DeepSeek V4 Pro:M3 唯一精准找到各公司年底 12/31 员工数、最接近一份真正的证券研究报告(主动搭建分析框架),但速度最慢。核心论点是 Coding 强不代表所有知识工作自然变强,每个领域有自己的 know-how,金融需要行业研究员参与训练与评估;M3 在金融 Benchmark 处开源第一梯队、周调用量登上 OpenRouter 第一。判断是:金融可能成为继 Coding 之后下一个模型竞争最激烈的场景(wiki/sources/2026-06-17-Coding 之外,MiniMax 在悄悄做另一件事。)。

[2026-08-10] FinEvo-Bench:首个纵向评测自进化金融 Agent 的基准

来源:评测日报 08-10。北航 + 阿里云通义点金联合发布(arXiv 2608.06144):120 真实任务 × 20 场景 × 6 金融领域,同场景 6 案例共享机构流程与人工 rubric——质量 + 合规双评。金融 agent 评测从单任务横评走向纵向进化评测的首例。

Qwen3.7-Max 为统一底座对比 4 种自进化 scaffold:

  • Letta 进化后最高分 91.65、合规问题最少(0.09/任务)
  • Codex 自进化增益最大(+19.37)
  • 第 4–6 个任务增益比第 1–3 个高 6.10–8.70 分——经验确在累积。

⚠️ 矛盾 [2026-08-10] 两个反直觉结论:只进化 skill 优于只进化 memory 或两者结合rubric 反馈普遍优于给参考答案——与 agent 工程的默认假设(记忆+技能协同、参考答案监督)冲突,值得在自有任务流上小规模复现。详见 Agent 自我改进

关联