# 工具能力全景与路由互补分析 > 版本: v1.0 | 日期: 2026-06-21 | 下一更新: 2026-Q3 > 用途: 蚂蚁军团各智能体能力边界定义 + 路由决策参考 --- ## 目录 - [1. 文档说明](#1-文档说明) - [2. Trae IDE](#2-trae-ide) - [3. Hermes Agent 框架](#3-hermes-agent-框架) - [4. Codex CLI (GPT-5.5)](#4-codex-cli-gpt-55) - [5. ChatGPT 网页版 / GPT-5.5](#5-chatgpt-网页版--gpt-55) - [6. Google Gemini 网页版](#6-google-gemini-网页版) - [7. OpenClaw 框架](#7-openclaw-框架) - [8. 六工具横评对比](#8-六工具横评对比) - [9. 路由互补分析](#9-路由互补分析) - [10. 蚂蚁军团路由决策矩阵](#10-蚂蚁军团路由决策矩阵) - [11. 异常修复链路](#11-异常修复链路) --- ## 1. 文档说明 ### 1.1 本文档定位 本文档是蚂蚁军团 **路由系统的能力参考书**。每个智能体/工具的能力边界在这里被明确定义,路由决策基于这些定义进行匹配,不做超出能力边界的任务分配。 ### 1.2 能力标签体系 每个工具使用以下标签体系描述: | 标签域 | 取值 | 说明 | |:-------|:-----|:------| | `cap:推理` | 高/中/低 | 复杂逻辑推理能力 | | `cap:编程` | 高/中/低 | 代码编写/审查/重构能力 | | `cap:搜索` | 高/中/低 | 联网信息检索能力 | | `cap:多模态` | 高/中/低 | 图像/音频/视频理解能力 | | `cap:自动化` | 高/中/低 | 自动化执行/流水线能力 | | `cap:通信` | 高/中/低 | 消息平台接入能力 | | `cap:自进化` | 高/中/低 | 自我学习/改进能力 | | `cap:长上下文` | 高/中/低 | 处理大文档/代码库的能力 | | `dep:本地` | ✅/❌ | 是否需要本地部署 | | `dep:联网` | ✅/❌ | 是否需要联网 | | `dep:付费` | ✅/❌ | 是否需要付费订阅 | | `cost:token` | $/M tokens | Token 消耗成本参考 | --- ## 2. Trae IDE ### 2.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发商 | 字节跳动 (ByteDance) | | 当前版本 | **v3.5.66** (2026-06-12) | | 内核 | VS Code fork,兼容 VS Code 插件生态 | | 注册用户 | 600万+ | | 定价 | 基础版免费 / Pro $10/月 | | 部署位置 | **本机 3号** (本任务运行环境) | | 模型支持 | Claude 3.5/3.7 Sonnet、GPT-4o/4.1、Gemini 2.5 Pro、豆包 1.5-pro、DeepSeek-R1/V3、Kimi K2.5/K2.6 | ### 2.2 双重开发模式 #### 模式A: IDE 模式(人机协同) 人类开发者主导,AI 全程辅助。保留传统编辑器、终端、调试、Git 等工作流。 | 内置 Agent | 定位 | 适用场景 | |:-----------|:-----|:---------| | **Chat** | 对话式编程助手 | 代码解释、技术问答、错误修复、代码生成 | | **Builder / Agent** | 0→1 项目构建 | 自然语言→完整项目,自动拆任务、生成文件、运行验证 | | **Builder with MCP** | MCP 扩展构建 | Builder + 自动启用所有配置的 MCP Server | #### 模式B: SOLO / Work 模式(AI 主导全自动化) 2026 年核心创新。描述需求 → AI 自动完成 PRD→编码→测试→部署全流程。 - **SOLO Builder**: 快速从想法到产品 - **SOLO Agent** (v3.5.56 起更名): 深度规划、精确执行、协调子智能体 - **三栏工作区**: 文件管理 + 实时进度 + AI 输出预览 - **语音交互**: 像和队友交流一样用语音互动 - **Worktree**: 不同任务在隔离 Git 环境中运行 - **内嵌浏览器**: 可直接选取浏览器元素加入对话 - **跨端同步**: Web/桌面/手机 三端进度实时同步 ### 2.3 核心能力 | 能力 | 说明 | 标签 | |:-----|:-----|:------| | **CUE 智能补全** | 实时感知仓库上下文,链式补全,智能导入,修改点预测 | `cap:编程=高` | | **上下文理解** | 文件/文件夹/代码库/文档集(URL爬取)/网页内容 | `cap:长上下文=高` | | **规则系统** | `.trae/rules/` 双层规则 (project_rules + user_rules),支持嵌套 | `cap:自动化=中` | | **MCP 支持** | stdio + SSE 传输,OAuth 授权,项目级/全局配置 | `cap:自动化=高` | | **Skills 技能** | `.agents/skills` 自动加载,社区共享,领域专长 | `cap:自进化=中` | | **代码审查** | 对未提交/单次提交/分支差异进行智能审查 | `cap:编程=高` | | **设计稿转代码** | Figma 设计稿直接转可运行代码 | `cap:多模态=中` | ### 2.4 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:-----| | `cap:推理` | 高 | 多模型内置,Claude/GPT/Gemini/豆包 均可 | | `cap:编程` | **极高** | AI IDE 原生,Builder 全自动化 | | `cap:搜索` | 中 | 可通过 MCP + 文档集 URL 爬取实现 | | `cap:多模态` | 中 | Figma 转代码、图片理解 | | `cap:自动化` | 高 | SOLO/Work 全自动化 + MCP | | `cap:通信` | 低 | IDE 本质,无消息平台接入 | | `cap:自进化` | 中 | Skills + Rules 可扩展 | | `cap:长上下文` | 高 | 仓库级上下文理解 | | `dep:本地` | ✅ | 本机安装 | | `dep:联网` | ⚠️ | 模型调用需联网 | | `dep:付费` | ⚠️ | 基础免费,Pro 可选 | | `cost:token` | ~$10/月 | Pro 订阅费 | ### 2.5 本机部署配置 ``` 安装位置: /media/zhengjie/WORKSPACE/003/.trae/ 规则目录: /media/zhengjie/WORKSPACE/003/.trae/rules/ ├── project_rules.md — 项目红线规则 ├── local-assets.md — 本地AI资产清单 └── server_infrastructure.md — 蚂蚁帝国架构文档 Skills目录: /media/zhengjie/WORKSPACE/003/.trae/skills/ ├── fenshen — 分身系统 ├── web-search — 联网搜索 ├── web-dev — 网页开发 └── ... ``` --- ## 3. Hermes Agent 框架 ### 3.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发商 | 开源社区 (Hermes Team) | | 最近版本 | v0.17.0 (2026-05) | | GitHub Stars | 61K+ | | 核心语言 | Python | | 定位 | 自进化个人智能体框架 | | 部署位置 | **本机 3号(小七)** / **2号(糖糖)** / **4号(蚁后)** | ### 3.2 版本历史 | 版本 | 日期 | 关键更新 | |:-----|:------|:---------| | v0.8.0 | 2025-12 | 初始开源版本 | | v0.9.0 | 2026-01 | pipx 安装, PIP模式 | | v0.10.0 | 2026-02 | Webhook 系统 | | v0.11.0 | 2026-02 | Task + Todo 系统 | | v0.12.0 | 2026-02 | 技能自动创建 | | v0.13.0 | 2026-03 | Delegate + Plan | | v0.14.0 | 2026-03 | Kanban 引擎 | | v0.15.0 | 2026-04 | MCP 集成 | | v0.16.0 | 2026-04 | 批量 MCP | | **v0.17.0** | **2026-05** | **最佳版本 — 混合MCP, Kanban v2** | ### 3.3 核心架构(六支柱) ``` ┌──────────────────────────────────────────┐ │ Hermes Agent v0.17.0 │ ├──────────────────────────────────────────┤ │ ① Webhook 系统 — 多智能体通信 │ │ ② Kanban 看板 — 任务分解+调度 │ │ ③ ACP 协议 — 四层消息标准 │ │ ④ 工具系统 — 60+内置 + MCP │ │ ⑤ 三层记忆 — HOT/WARM/COLD │ │ ⑥ 技能系统 — 自创建+自优化+Bundle │ └──────────────────────────────────────────┘ ``` ### 3.4 核心能力 #### 3.4.1 Webhook 系统(蚂蚁帝国核心通信协议) | 配置项 | 值 | |:-------|:----| | 监听端口 | 8644 (所有实例统一) | | 签名算法 | HMAC-SHA256 | | 协议路径 | `POST /webhooks/{订阅名}` | | 消息体 | JSON `{"event_type", "report"}` | **蚂蚁帝国 Webhook 订阅清单**: | Agent | 服务器 | 订阅名 | 用途 | |:------|:-------|:-------|:-----| | **蚁后**👑 | 4号 | `ant-message` | → 投递飞书 | | | | `pipeline-report` | 生图流水线巡检 | | | | `xiaogenban` | 小跟班消息 | | **糖糖**🐜 | 2号 | `tangtang-message` | 金融消息 | | **小七**🐱 | 本机 | `xiaoqi-message` | 通用消息 | | **Trae IDE** | 4号:8893 | `/api/webhook` | 人工查阅 | #### 3.4.2 Kanban 看板引擎(v0.14+) | 属性 | 值 | |:-----|:----| | 存储 | SQLite 持久化 (kanban.db) | | 轮询间隔 | 60秒 (config.yaml 484行) | | 六列流程 | Backlog → TODO → In Progress → Review → Done → Archived | | Worker 类型 | 9种 (delegate/plan/clock/batch/depend/delay/chapter/interrupt/extract) | | 超时回收 | 4小时自动回收 | | 失败重试 | 自动重试,失败升级 | **配置位置**: config.yaml 477-487行 ```yaml kanban: enabled: true db_path: "~/.hermes/kanban.db" poll_interval: 60 workers: [todo, delegate_task, plan, writing-plans] ``` #### 3.4.3 ACP 通信协议(Agent Communication Protocol) | 消息类型 | 说明 | 路由依据 | |:---------|:-----|:---------| | **Command** | 直接指令 | sender → recipient, 需回复 | | **Request** | 请求协作 | sender → recipient, 可拒绝 | | **Notification** | 单向通知 | sender → topic, 不要求回复 | | **Report** | 任务汇报 | sender → topic, 含结果摘要 | #### 3.4.4 工具系统 **内置工具** (60+): | 工具名 | 用途 | 备注 | |:-------|:-----|:------| | `todo` | 当前会话任务清单 | 小七核心工具 | | `delegate_task` | 拆成子任务并行执行 | 可并行3个子代理 | | `plan` | 专门写方案的"计划模式" | 只出方案不执行 | | `writing-plans` | 细粒度实施计划 | 拆成2-5分钟小任务 | **MCP 集成** (v0.15+): - 支持作为 MCP 客户端连接外部服务器 - v0.16: 批量 MCP 服务器管理 - v0.17: 混合 MCP(同时连接多个 MCP 服务器) #### 3.4.5 三层记忆系统 | 层级 | 存储 | 特点 | |:-----|:-----|:------| | **HOT** | session context | 当前会话上下文 | | **WARM** | MEMORY.md | 持久事实,跨会话 | | **COLD** | SQLite + FTS5 | 全文搜索历史记忆 | | **技能** | SKILL.md | 可执行的过程记忆 | #### 3.4.6 技能系统 - 自动创建: `hermes skills create` - 自我优化: 运行后自动分析改进 - Bundle 机制: `skills/bundles/` 组合技能 ### 3.5 蚂蚁帝国部署实例 | 实例 | 服务器 | 版本 | 模型 | 角色 | |:-----|:-------|:-----|:-----|:------| | **小七**🐱 | 3号本机 | v0.15+ | qwen3.5-4b + qwen3.5-9b-vision | 交互型AI - 文官 | | **糖糖**🐜 | 2号 | v0.15+ | (无本地模型) | 金融中台 - 武官自治 | | **蚁后**👑 | 4号 | v0.15+ | (无模型配置) | 生图调度 - 武官 | ### 3.6 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:推理` | 中 | 依赖配置的模型 | | `cap:编程` | 低 | 非编程框架 | | `cap:搜索` | 低 | 无原生搜索 | | `cap:多模态` | 中 | 依赖配置的视觉模型 | | `cap:自动化` | 高 | Kanban + Webhook + Cron | | `cap:通信` | **极高** | Webhook 原生多智能体通信 | | `cap:自进化` | **极高** | 唯一具备自我学习能力的框架 | | `cap:长上下文` | 中 | SQLite FTS5 搜索 | | `dep:本地` | ✅ | 需本地部署 | | `dep:联网` | ⚠️ | 视模型配置 | | `dep:付费` | ❌ | 开源免费 | --- ## 4. Codex CLI (GPT-5.5) ### 4.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发商 | OpenAI | | 当前版本 | **v0.137.0** (2026-06-04) | | 核心语言 | Rust 95.7% (从 TS 重写完成) | | GitHub Stars | 90K+ | | 授权 | 开源 + Codex Plus 订阅 | | 底座模型 | **GPT-5.5** (400K上下文) | | 部署位置 | **5号服务器** (ws://127.0.0.1:18795) | | 订阅 | Codex Plus ($20/月,含在 ChatGPT Plus) | ### 4.2 模型能力矩阵 | 模型 | 上下文 | 定价 (输入/输出 /1M) | 定位 | |:-----|:-------|:---------------------|:------| | **GPT-5.5** | 400K | $5/$30 | **编程旗舰** — Terminal-Bench 82.7% | | GPT-5.5 Pro | 400K | $30/$180 | 最高精度 | | GPT-5.4 | 272K (可扩1M) | $2.50/$15 | 性价比之选 | | GPT-5.3-Codex-Spark | 标准 | Pro专属 | 1000+ tokens/s | **基准成绩**: | 测试 | GPT-5.5 | 对比 | |:-----|:--------|:------| | Terminal-Bench 2.0 | **82.7%** | +7.6pp vs GPT-5.4 | | SWE-Bench Pro | 58.6% | +0.9pp | | Expert-SWE (20h任务) | **73.1%** | +4.6pp | | OSWorld (Computer Use) | **78.7%** | +3.7pp | | ARC-AGI-2 (推理) | **85.0%** | +11.7pp | ### 4.3 子代理(Subagent)系统 ``` 用户指令 → 主 Agent (Manager) ├── Subagent 1 (Worker) — 实现模块A ├── Subagent 2 (Worker) — 实现模块B ├── Subagent 3 (Explorer) — 代码库探索 └── Subagent 4 (Monitor) — 长任务监控 ``` | 角色 | 权限 | 职责 | |:-----|:-----|:------| | default | 通用 | 兜底 | | worker | 写权限 | 实现和修复 | | explorer | 只读 | 代码库探索 | | monitor | 只读 | 1小时轮询监控 | **v0.137.0 Multi-agent v2 新特性**: - 每个线程可独立选择模型 - CLI `/agent` 切换线程视图 - 审批弹窗标明来源线程 ### 4.4 MCP 集成 #### 作为 MCP 客户端(消费 MCP): ```toml [mcp_servers.filesystem] command = "npx" args = ["-y", "@modelcontextprotocol/server-filesystem"] ``` #### 作为 MCP 服务器(被消费) — 关键能力: ``` codex mcp-server → 暴露2个工具: codex(prompt, config...) → 启动新会话 codex-reply(prompt, threadId) → 继续会话 ``` **应用**: 其他 Agent 可通过 MCP 调用 Codex 执行编程任务。 ### 4.5 Browser Use(浏览器自动化) | 层级 | 方式 | 能力 | |:-----|:------|:------| | Tier 1 | Computer Use | 像素级 GUI 自动化 | | Tier 2 | Browser Use + Dev Mode | DOM感知 + CDP,内置沙箱 | | Tier 3 | Chrome DevTools MCP | 29个 DevTools 工具 | **Chrome 扩展** (2026-05-07): 操作已登录的 Chrome 会话,跨 Tab 并行。 ### 4.6 App-Server Daemon 模式 ``` 客户端 (CLI/VS Code/网页) │ JSON-RPC 2.0 协议 ▼ App Server (ws://127.0.0.1:18795) ├── Thread Manager (多会话管理) ├── Core Threads (每个线程一个 Codex 会话) └── MCP Server 桥接 ``` ### 4.7 本机部署配置 (5号服务器) ``` 版本: v0.137.0 服务: codex app-server daemon start --listen ws://127.0.0.1:18795 进程: node + codex-linux-x64 双进程 公网: en.hunanningyuan.cloud/codex/ (HTTP Basic Auth) 前端: /var/www/codex-chat/index.html (WebSocket JSON-RPC) ``` ### 4.8 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:推理` | 极高 | GPT-5.5 旗舰推理 | | `cap:编程` | **极高** | **全工具中最强**,Terminal-Bench 82.7% | | `cap:搜索` | 中 | WebSearch 工具 | | `cap:多模态` | 中 | Vision 能力 (GPT-5.5) | | `cap:自动化` | 高 | Subagent + MCP + App Server | | `cap:通信` | 低 | 无消息平台接入 | | `cap:自进化` | 中 | 无闭环学习 | | `cap:长上下文` | **极高** | 400K (CLI) / 1M (API) | | `dep:本地` | ✅ | 需本地部署 (5号) | | `dep:联网` | ✅ | 需调用 OpenAI API | | `dep:付费` | ✅ | Codex Plus $20/月 | | `cost:token` | $5/$30 per M | GPT-5.5 定价 | --- ## 5. ChatGPT 网页版 / GPT-5.5 ### 5.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发商 | OpenAI | | 旗舰模型 | GPT-5.5 (2026-04-23) / GPT-5.5 Instant (2026-05-05, 默认) | | 知识截止 | 2025-08-31 | | 上下文 | Instant 400K / Pro 1M | | 定价 | Free / Plus $20/mo / Pro $200/mo | | 访问方式 | 网页 chatgpt.com + iOS/Android + Atlas 浏览器 | ### 5.2 模型分层 | 用户 | 可用模型 | |:-----|:---------| | Free | GPT-5.5 Instant | | Plus $20 | Instant / Medium / High | | Pro $200 | Instant / Medium / High / Extra High / Pro Standard / Pro Extended | ### 5.3 核心功能 #### 沟通与写作 - **Canvas 编辑器**: 全屏写作、目录导航、交互式图表、PDF 导出、Library 保存 - **长对话目录**: 超5轮自动生成,可跳转 - **导出**: PDF(保留表格/图片/引用) #### 编程与数据分析 - **Code Interpreter**: 沙箱 Python,支持 pandas/numpy/matplotlib/PIL - **文件处理**: 最大 100MB(CSV/JSON/Excel/图片/视频) - **数据可视化**: 交互式图表生成 - **格式转换**: CSV↔Excel、JSON↔XML 等 - **代码生成/调试**: 编写、解释、重构、优化 #### 网页浏览 - **Atlas 浏览器** (2025-10): AI 原生浏览器,侧边栏常驻 ChatGPT - **Agent Mode** (Plus+): 自动执行网页任务(预订/填表/比价) - **Browse with Bing**: 实时搜索+引用 #### 图像生成(DALL-E) - 直接调用 DALL-E 生成图像 - 多模态视觉: 图片理解+图表解读+文档OCR+截图分析 #### Apps 生态(MCP 协议) - **Apps SDK** (2025-10): 基于 MCP 协议,首批 7+ 大厂接入 - **首批**: Booking.com/Canva/Coursera/Figma/Expedia/Spotify/Zillow - GPT-5.5 自动识别何时启用 App - **Google Drive 集成** ✅ **已确认可用**: 通过 Apps/MCP 直接连接 Google Drive - ✅ 读取指定目录文件列表 - ✅ 读取/修改文档、图片、**代码文件**等内容 - ✅ 上传新文件到云盘 - ⚠️ **重要路由意义**: - 以前云盘操作只能通过 5hao rclone,现在 ChatGPT 可通过 MCP 直接操作 - **代码分析**: 云盘上的代码项目可用 ChatGPT 直接审查/分析/调试 - **零中转链路**: 文字指令 → 云盘取图/取码 → AI处理 → 结果存回云盘 #### 语音对话 - 高级语音模式: 指令理解增强 + 自适应风格 - GPT-Realtime-2: 低延迟语音模型 - 跨平台: Web/iOS/Android/Atlas #### 记忆功能 - 记忆摘要页: 可视化所有记忆条目,可编辑/删除 - 记忆来源: 标记来自哪个聊天/文件/Gmail - 临时对话: 不生成/参考记忆 #### 定时任务 (2026-06-17) - Scheduled Tasks: 发送提醒、重复工作、监控变化 - 侧边栏 "Scheduled" 页面集中管理 - 最少1小时间隔 ### 5.4 核心升级亮点 1. **幻觉率降低 52.5%** (高价值场景) 2. **回答长度优化**: 字数减少 30.2%,emoji 过度使用显著减少 3. **Terminal-Bench 82.7%**: 全 AI IDE 第一 4. **400K → 1M 上下文**: 512K-1M 区间准确率 74.0% (相比 GPT-5.4 的 36.6%) ### 5.5 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:推理` | 极高 | GPT-5.5 旗舰 | | `cap:编程` | 高 | 58.6% SWE-Bench, 但不如 Codex CLI | | `cap:搜索` | 高 | Browse + Deep Research | | `cap:多模态` | 高 | DALL-E + Vision + Code Interpreter | | `cap:自动化` | 中 | Scheduled Tasks + Apps | | `cap:云盘操作` | **新高** | **通过Apps (MCP) 直接读写Google Drive文件** | | `cap:通信` | 低 | 网页版本质 | | `cap:自进化` | 中 | Memory 跨会话学习 | | `cap:长上下文` | 极高 | Instant 400K / Pro 1M | | `dep:本地` | ❌ | 纯云端 | | `dep:联网` | ✅ | 必需 | | `dep:付费` | ⚠️ | Plus 才可用全部功能 | | `cost:token` | $20-200/月 | 订阅制 | --- ## 6. Google Gemini 网页版 ### 6.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发商 | Google | | 旗舰模型 | Gemini 2.5 Pro / 2.5 Flash (默认) | | 上下文 | 免费 32K / 付费 **100万 token** | | 定价 | Free / Pro $19.99/月 / Ultra $249.99/月 | | 月活用户 | 9亿+ (2026 I/O) | | 覆盖 | 230+ 国家、70+ 语言 | ### 6.2 模型矩阵 | 模型 | 定位 | 上下文 | 可用性 | |:-----|:------|:-------|:-------| | Gemini 2.5 Pro | 最强推理/编程/复杂任务 | 100万token (付费) | 正式版 | | Gemini 2.5 Flash | 日常任务, 快速响应 | 100万token | **默认模型** | | Gemini 2.5 Flash-Lite | 高吞吐低成本批量 | 100万token | 正式版 | | Gemini 3 Flash | 前沿智能+闪电速度 | — | 已发布 | | Gemini 3.5 Flash | 新一代前沿+超快 | — | I/O 2026发布 | | Gemini Omni | 文本/图像/视频→视频输出 | — | I/O 2026发布 | ### 6.3 核心功能 #### Deep Research 深度研究 - **模型**: 2.5 Flash Experimental / 2.5 Pro Experimental (Advanced) - **文件上传**: PDF/图片融合到研究报告 - **Google Drive**: 链接云端文档 - **Canvas 导出**: 导入 Canvas 编辑 → 导出 Google Docs - **效果**: 写作调研时间减少 63% (2.5h→55min) - **质量**: 比 ChatGPT 更稳定,学术风格带引文 #### 文件上传与分析 | 层级 | 支持格式 | 限制 | |:-----|:---------|:------| | 免费 | DOC/DOCX/PDF/TXT/PPTX/PNG/JPG/WEBP/视频 | 10个文件, 单文件100MB | | Pro | + XLS/XLSX/CSV/TSV/代码文件夹 | 数据可视化+代码库分析 | #### Google 生态集成(核心差异化 — ✅ 已确认可用) | 服务 | 能力 | |:-----|:------| | Gmail | 邮件摘要、撰写、搜索 | | Google Drive | 文件分析、文档链接 | | Google Docs | "//" 唤醒 AI 助手,**可直接创建/编辑 Google Docs 文档** | | Google Maps | 推荐、旅行建议 | | Google Calendar | 日程管理 | | Google Search | 个性化搜索(连接搜索历史) | - ✅ **已验证**: - 可基于分析报告直接生成 Google Docs 并存到指定目录 - **图片分析上限分 4 种路径**: - 网页聊天: **单次硬限制 10 张**(前端阻断) - API / AI Studio: **最高 3,000 张/次**(底层无上限) - PDF 打包: 图片插入 PDF = 1 个文件,**PDF 可达 1,000 页** - 上下文累积: 分批次 10 张多次上传,模型保留前序图片联合推理 - **路由意义**: 大批量图片分析应走 API 或打包 PDF,而非网页聊天 - **零中转**: 分析结果直接以 Google Docs 落地云盘,无需手动导出 - ✅ **API Key 实测(2026-06-21, AQ.密钥 - Free Tier)**: - **文字模型 ✅ 正常**: gemini-3.1-flash-lite 可用(10-15 RPM, 1,000-1,500 RPD) - **生图模型 ❌ 锁死**: gemini-2.5-flash-image / imagen-4.0 / veo-3.1 均 429 quota exceeded (limit: 0) - **结论**: 新账号免费层生图额度默认锁死,需绑结算账户才能开 - **可用场景**: 打标、提示词优化、文案生成、数据分析 #### Gemini Live 语音对话 - 自然对话,打字↔语音随时切换 - 摄像头/屏幕共享(免费用户可用) - Gemini 3.1 Flash Live: ComplexFuncBench Audio 90.8% #### Canvas 协作工作区 - 交互式空间,编写/润色/分享 - 选中段落→要求简化/调整语气/专业 - 实时代码预览 (HTML/React) - 导出到 Google Docs #### 多模态能力(核心差异化) - **原生多模态**: 单一模型架构统一处理文本/图像/音频/视频 - 10M token 上下文(1.5 Pro 实测 "大海捞针" >99% 召回) - 长时间音频理解、YouTube 视频处理 #### Gems 自定义智能体 - 创建专属 AI 专家 - 配置提示词即可生成 #### 图像/视频生成(Nano Banana + Veo) | 引擎 | 定位 | 模型 | 能力 | |:-----|:------|:------|:------| | **Nano Banana** (Imagen 3 演进) | 原生生图主力 | gemini-3.1-flash-image / gemini-3-pro-image | Fast/Thinking/Pro 三档 | | **Veo** 系列 | 高阶/视频/4K | veo-3.1-generate / veo-3.1-fast-generate | 视频→图片、4K输出 | **Nano Banana 核心绝活**: - **图生图**: 同时上传最多 **14 张**参考图片进行融合重构 - **精准字形渲染**: 衣服/店招/海报上的文字不再乱码,清晰可读 - **SynthID 水印**: 可见+不可见双重数字水印,商业合规 - **Prompt Expansion**: 输入长句自动重构丰富提示词,理解精度远超普通生图工具 **Veo 核心绝活**: - **Video-to-Image**: 从视频帧语义衍生高质量静态图 - **4K 分辨率**: 输出/放大至 4K 商业级画质 **路由意义**: Gemini 生图+精准文字渲染 = **商品卡/海报设计的一站式工具**,不再需要经过"生图→PS加字"两步流程 #### I/O 2026 新增 - **Daily Brief**: 每日智能简报 - **Gemini Spark**: 7×24 主动式 AI 智能体 - **Neural Expressive**: 流体动画 UI 设计语言 - **macOS 桌面应用**: 本地运行 Gemini Spark ### 6.4 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:推理` | 极高 | 2.5 Pro 在 WebDev Arena 登顶 | | `cap:编程` | 高 | Aider 编程基准 74% | | `cap:搜索` | **极高** | **全工具中最强**,Deep Research | | `cap:多模态` | **极高** | **全工具中最强**,原生多模态 | | `cap:生图` | **极高** | **Nano Banana + Veo, 14张参考图, 4K, 精准文字** | | `cap:自动化` | 中 | Scheduled Tasks | | `cap:通信` | 低 | 网页版本质 | | `cap:自进化` | 低 | 无跨会话学习 | | `cap:长上下文` | **极高** | **100万token** 付费版 | | `dep:本地` | ❌ | 纯云端 | | `dep:联网` | ✅ | 必需 | | `dep:付费` | ⚠️ | Pro 才可用全部功能 | | `cost:token` | $19.99-249.99/月 | 订阅制 | --- ## 7. Google 2026 生态全家桶(Gemini 驱动的 Agentic 原生生态) > 谷歌在 2026 年完成了从"互联网工具箱"到"智能体化原生生态"的蜕变。全部工具通过 Gemini 3 系列及以上 AI 矩阵打通,形成主动规划、自主执行、跨端同步的超级闭环。 ### 7.1 五大中枢架构 | # | 中枢 | 核心能力 | 路由标签 | |:--|:-----|:---------|:---------| | ① | **Workspace**(效率协同) | 邮件自动化、Docs 信息消化、NotebookLM 第二大脑、Sheets/Slides 智能图表 | `cap:办公` | | ② | **Search & Chrome**(信息入口) | AI Mode 搜索、Deep Research、Auto Browse 网页自动化、Skills 技能市场 | `cap:搜索` | | ③ | **Android 17 & Halo**(系统感知) | Gemini 全域屏幕感知、Halo 状态光环、24/7 后台智能体 | `cap:移动` | | ④ | **GenMedia Suite**(多模态生成) | Nano Banana Pro 生图(精准文字+品牌定制)、Veo 3.1 电影级视频+原生音频 | `cap:生图` | | ⑤ | **Vertex AI & Cloud**(云端基建) | MCP 多智能体编排、GKE 集群调度、TPU Superpods 万级芯片互联 | `cap:基建` | ### 7.2 五大中枢详解 #### 7.2.1 效率与协同中枢 — Workspace | 组件 | Agentic 能力 | 场景 | |:-----|:-------------|:-----| | **Gmail + Gemini Agents** | 自动总结长邮件、提取合同财务红线、草拟回复 | 邮件自动化流水线 | | **Docs + NotebookLM** | 多模态联合检索(PDF/表格/音频),自然语言向 Drive 提问 | 第二大脑持久记忆 | | **Sheets** | 自动生成交互式图表、分析财务趋势 | 数据可视化 | | **Slides + Nano Banana Pro** | 根据演示文稿语义自动生成带精准文字的高清插图 | 一键出片 | #### 7.2.2 信息与入口中枢 — Search & Chrome | 能力 | 驱动模型 | 说明 | |:-----|:---------|:------| | **AI Mode 搜索** | Gemini 3.5 Flash | 从链接列表→AI 推理助理 | | **Deep Research** | Gemini 多步追踪 | 跨平台多步追踪,交付引文级报告 | | **Auto Browse** | Chrome Agent | 自动预订、比价、批量填表 | | **Skills 市场** | Chrome 侧边栏 | 固话常用 Prompt 为一键工具 | #### 7.2.3 操作系统与硬件 — Android 17 & Halo - **Gemini Intelligence 核心层**: 系统级 AI,全域屏幕感知 - **长按/手势圈选**: 任意 App 内圈内容→理解→操作(如食谱→自动添加到 Keep 备忘录) - **Android Halo**: 后台 24/7 智能体状态光环,无需打开 App 即可追踪 #### 7.2.4 创意与多模态生成 — GenMedia Suite | 引擎 | 能力 | 路由价值 | |:-----|:-----|:---------| | **Nano Banana Pro** | 多语言文字渲染、多图融合、品牌定制、版型不走样 | 商品卡/海报一站式设计 | | **Veo 3.1** | 电影级视频+原生音频同步(对白/音效/配乐) | AI 短视频/广告片 | #### 7.2.5 底层与云端 — Vertex AI & Cloud - **Vertex AI Agents**: MCP 协议跨接数据库与工具链 - **GKE**: 成百上千 Agent 工作负载集群调度 - **TPU Superpods + Lustre**: 万级芯片互联,解决长任务 IO 瓶颈 ### 7.3 谷歌生态的"最强互补路径" ``` Drive/NotebookLM(存储+管理) ↓ Search Deep Research(全网调研) ↓ Vertex AI / Chrome Auto Browse(批量脚本+网页操控) ↓ Gmail / Docs(全自动协作交付) ``` **路由意义**: 如果要深度依赖谷歌生态,最优链路是:**数据存储 → 全网检索 → 自动化执行 → 交付产出**。这条链全部由 Gemini 底层打通,零中转。 ### 7.4 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:办公` | **极高** | Workspace 全链条 AI 化 | | `cap:搜索` | **极高** | Deep Research 全网多步追踪 | | `cap:多模态` | **极高** | GenMedia Suite + 系统级感知 | | `cap:生图` | **极高** | Nano Banana Pro + Veo 3.1 | | `cap:视频` | **极高** | Veo 3.1 电影级+原生音频 | | `cap:网页自动化` | 高 | Chrome Auto Browse | | `cap:基建` | **极高** | Vertex AI + GKE + TPU | | `cap:自进化` | 高 | 每日简报/Spark 主动式智能体 | | `dep:本地` | ❌ | 纯云端 | | `dep:付费` | ⚠️ | 免费 API 1000-1500次/天 | | `cost:token` | 免费层可用 | Pro $19.99-249.99/月 | ### 7.5 第二大脑(NotebookLM + Drive)实现方案 > Gemini 驱动,将 Google Drive 变成多模态联合检索的"第二大脑"。 #### 方案一:蚂蚁军团自动化管线(工业级) ``` Drive 输入目录 → 新文件触发 → 多模态解析 → 向量化 → 自然语言提问 → 自动输出 Docs ``` | 步骤 | 组件 | 说明 | |:-----|:-----|:------| | ① 存储/监听 | Google Drive API + Webhook/定时脚本 | 监听 `02_COLLECT_CENTER_集货区` | | ② 解析/向量化 | Gemini API + Vector DB | 文本→MD, 音频→摘要, 表格→JSON | | ③ 联合检索 | RAG: 向量库 + Gemini 大上下文 | 跨PDF/表格/音频联合推理 | | ④ 自动导出 | Google Docs API | 自动创建排版报告 | **路由意义**: 这个管线可以让小七/小马等文官通过自然语言直接查询整个云盘的知识库,无需手动翻文件。 #### 方案二:NotebookLM 原生方案(轻量体验) - **创建笔记本**: 一个笔记本 = 一个商业项目/知识库 - **绑定 Drive**: 直接选整个文件夹或批量选文件(Docs/Sheets/PDF/MP3) - **自动向量化**: 后台自动切片、多模态理解、索引 - **提问方式**: 中文提问,同时跨越表格/PDF/音频联合推理,**严格标注引文出处** - **一键导出**: 精炼结果→导出到 Google Docs **路由意义**: 日常知识管理直接走 NotebookLM 网页版,比自建管线快10倍。 --- ## 8. OpenClaw 框架 ### 8.1 基本信息 | 属性 | 值 | |:-----|:----| | 开发者 | Peter Steinberger → 开源基金会 (2026-02) | | GitHub Stars | **346,000+** (2026-05) | | 核心语言 | TypeScript / Node.js | | 许可 | MIT | | 定位 | AI Agent Harness — 智能体"挽具" | | 技能市场 | ClawHub — 13,000+ 社区技能 | | 部署位置 | **4号服务器** (2个实例) | ### 8.2 核心架构 ``` 用户消息渠道 (50+ 平台) Telegram / WhatsApp / Slack / Discord / 飞书 / 钉钉 / 微信 / QQ ... │ ▼ ┌─── OpenClaw Gateway ──────────────────────┐ │ 消息网关 + 协议转换 + 心跳调度 │ │ 绑定 127.0.0.1:18789 │ └──────────────────┬─────────────────────────┘ │ ▼ ┌─── Agentic Loop (智能体循环) ─────────────┐ │ 1. 加载 SOUL.md(身份/价值观) │ │ 2. 加载 HEARTBEAT.md(定时任务清单) │ │ 3. 从 SQLite 检索记忆 │ │ 4. 调用 LLM 推理 │ │ 5. 执行工具/技能 │ │ 6. 写回 SQLite │ │ 7. 必要时压缩记忆 │ └──────────────────┬─────────────────────────┘ │ ▼ ┌─── 工具层 ────────────────────────────────┐ │ 浏览器(CDP) │ Shell │ 文件系统 │ MCP │ │ 代码执行 │ 网页搜索 │ 数据库 │ Email │ └──────────────────┬─────────────────────────┘ │ ▼ ┌─── Skills 生态 ───────────────────────────┐ │ ClawHub 13,000+ 技能 │ 自定义 TypeScript │ │ MCP Server 集成(700+ MCP 服务器可用) │ └────────────────────────────────────────────┘ ``` ### 8.3 七大核心子技能包 #### Heartbeat 心跳(核心差异化) - **30 分钟**自动触发 Agentic Loop - 读取 HEARTBEAT.md 中的待办清单 - 无任务时返回 `HEARTBEAT_OK` 静默标记 - 7×24 自主巡检,其他框架无此能力 #### MCP 原生支持 - 原生 MCP 客户端(非插件,非桥接) - 700+ MCP 服务器可用 - 配置一行 JSON 即可接入 - 热加载 + mcporter 自然语言管理 #### 身份/配置(纯 Markdown) | 文件 | 作用 | |:-----|:------| | SOUL.md | 灵魂 — 人格/价值观/行为边界 | | IDENTITY.md | 身份 — 名字/介绍风格 | | AGENTS.md | 多智能体路由规则 | | HEARTBEAT.md | 定时任务清单 | | MEMORY.md | 持久记忆 | | USER.md | 用户画像 | #### ClawHub 技能市场 - 13,000+ 社区技能 - 53个官方捆绑技能 - 分类: 生产力/开发/自动化/社交媒体/AI/家居 - CLI + 聊天窗口均可安装管理 #### 记忆系统 | 层级 | 存储 | 特点 | |:-----|:-----|:------| | HOT | memory/hot/HOT_MEMORY.md | 会话级任务状态 | | WARM | memory/warm/WARM_MEMORY.md | 跨会话偏好/引用 | | COLD | MEMORY.md | 长期里程碑 | | 日志 | memory/YYYY-MM-DD.md | 审计追溯 | #### 智能体调度模式 | 模式 | 描述 | |:-----|:------| | 响应式 | 用户消息 → 立即响应 | | 心跳式 | 定时 (30min) 自动巡检 | | Webhook | 外部 HTTP 触发 | | Cron | 精确时间点执行 | ### 8.4 4号服务器部署实例 #### 实例A (系统级 /root/.openclaw/) | 配置 | 值 | |:-----|:----| | systemd | openclaw-mcp.service (Restart=always) | | Gateway 端口 | 10701 | | WebSocket | 18800/ws | | 模型 | DeepSeek | | 飞书 App | cli_a9e72a91f478d26f | #### 实例B (/data/xiaofeng-config/) | 配置 | 值 | |:-----|:----| | Gateway 端口 | 10701 (同端口) | | 模型 | DeepSeek + 智谱 GLM4 | | 飞书 App | cli_a955aa3075789bd2 | | 特点 | 含完整记忆系统 + 梦境系统 | #### 技能仓库 (/root/openclaw-skills/) - @openclaw/feishu 飞书插件 - ah-agent-organizer 分身组织技能 ### 8.5 能力标签 | 标签 | 值 | 备注 | |:-----|:----|:------| | `cap:推理` | 中 | 依赖配置的 LLM | | `cap:编程` | 低 | 非编程框架 | | `cap:搜索` | 中 | 通过技能实现 | | `cap:多模态` | 低 | 无原生多模态 | | `cap:自动化` | **极高** | Heartbeat 7×24 自主巡检 | | `cap:通信` | **极高** | **全工具中最强**,50+ 平台 | | `cap:自进化` | 低 | 无闭环学习 | | `cap:长上下文` | 中 | 64K+ 上下文窗口 | | `dep:本地` | ✅ | 需本地部署 | | `dep:联网` | ⚠️ | 视 LLM 配置 | | `dep:付费` | ❌ | 开源免费 | --- ## 9. 六工具横评对比 ### 9.1 能力雷达 | 工具 | 推理 | 编程 | 搜索 | 多模态 | 自动化 | 通信 | 自进化 | 长上下文 | |:-----|:-----|:-----|:-----|:-------|:-------|:-----|:-------|:---------| | **Trae IDE** | 高 | **极高** | 中 | 中 | 高 | 低 | 中 | 高 | | **Hermes** | 中 | 低 | 低 | 中 | 高 | **极高** | **极高** | 中 | | **Codex CLI** | **极高** | **极高** | 中 | 中 | 高 | 低 | 中 | **极高** | | **ChatGPT** | **极高** | 高 | 高 | 高 | 中 | 低 | 中 | **极高** | | **Gemini** | **极高** | 高 | **极高** | **极高** | 中 | 低 | 低 | **极高** | | **OpenClaw** | 中 | 低 | 中 | 低 | **极高** | **极高** | 低 | 中 | ### 9.2 部署与成本 | 工具 | 本地部署 | 联网必需 | 付费 | 成本 | |:-----|:---------|:---------|:-----|:------| | **Trae IDE** | ✅ 本机 | ⚠️ 模型需联网 | ⚠️ 免费/Pro | $0-10/月 | | **Hermes** | ✅ 3/2/4号 | ⚠️ 视模型 | ❌ 开源免费 | $0 | | **Codex CLI** | ✅ 5号 | ✅ OpenAI API | ✅ Plus | $20/月 + API | | **ChatGPT** | ❌ 云端 | ✅ 必需 | ⚠️ Plus | $20-200/月 | | **Gemini** | ❌ 云端 | ✅ 必需 | ⚠️ Pro | $19.99-249.99/月 | | **OpenClaw** | ✅ 4号 | ⚠️ 视 LLM | ❌ 开源免费 | $0 | ### 9.3 最强项一览 | 能力 | 最强工具 | 数值/说明 | |:-----|:---------|:----------| | 编程 | **Codex CLI** | Terminal-Bench 82.7%, SWE-Bench 58.6% | | 搜索 | **Gemini** | Deep Research, Google 生态 | | 多模态 | **Gemini** | 原生统一架构, 10M token | | 通信 | **OpenClaw / Hermes** | OpenClaw 50+平台 / Hermes Webhook | | 自动化 | **OpenClaw** | Heartbeat 7×24 自主巡检 | | 自进化 | **Hermes** | 唯一具备闭环学习的框架 | | 推理 | **GPT-5.5 (Codex/ChatGPT)** | Artificial Analysis Index 60.24 | | 长上下文 | **Gemini** | 100万token (付费) | | 中文适配 | **Trae IDE** | 原生中文技术术语支持 | | 全栈 IDE | **Trae IDE** | SOLO/Work 全自动化流程 | | 零代码部署 | **OpenClaw** | 5分钟配置, 纯 Markdown | --- ## 10. 路由互补分析 ### 10.1 蚂蚁军团分工策略 基于"文武分治 + 主备双核"的路由架构: ``` 路由决策者 ┌──────────┐ 开机 → │ Trae │ (主帅/主核) ├──────────┤ 本机关机 → │ 蚁后 │ (云端代拆/备核) └──────────┘ │ 拆解任务 ▼ ┌─────────────────────────┐ │ 任务路由分配中心 │ │ (能力标签匹配引擎) │ └─────────────────────────┘ │ │ │ ┌────────┘ │ └────────┐ ▼ ▼ ▼ ┌──────────┐ ┌──────────┐ ┌──────────┐ │ 文官 │ │ 武官 │ │ 苦力 │ │ (动脑) │ │ (动手) │ │ (脚本) │ └──────────┘ └──────────┘ └──────────┘ ``` ### 10.2 文官阵营(动脑 — 分析/检查/决策) | 智能体 | 工具基底 | 能力上限 | 路由规则 | |:-------|:---------|:---------|:---------| | **小七🐱** (3号) | Hermes + qwen3.5 | 视觉推理/语音/文本清洗 | `cap:自进化=高` → 设计审核/内容鉴赏 | | **小马🐴** (5号) | Hermes | 日志分析/JSON校验/异常定界 | `cap:自动化=高` → 定时巡检/归档 | **小马铁律**: 只看不修,发现异常→暂停→飞书请示Boss→批准后才派Codex修。 ### 10.3 武官阵营(动手 — 执行/实现/生产) | 智能体 | 工具基底 | 能力上限 | 路由规则 | |:-------|:---------|:---------|:---------| | **蚁后👑** (4号) | Hermes + 生图流水线 | 可灵AI生图/商品库/CDP | `size:>100` → 大规模生图 | | **糖糖🐜** (2号) | Hermes | 金融爬虫/ETL/向量库 | `domain:金融` → 完全自治 | | **Codex** (5号) | Codex CLI v0.137.0 | 编程/代码修复/环境急救/浏览器CDP | `type:编程` `cap:编程=极高` | ### 10.4 能力互补路线图 ``` ┌─────────────────────────────────────┐ │ 任务需求入口 │ └─────────────────────────────────────┘ │ ┌──────────────┴──────────────┐ │ │ 需编程能力? 需通信能力? │ │ ┌────┴─────┐ ┌────┴─────┐ │ │ │ │ 是 否 是 否 │ │ │ │ ▼ │ ▼ │ ┌────────┐ │ ┌──────────┐ │ │ Codex │ │ │ OpenClaw │ │ │(5号) │ │ │ / Hermes │ │ └────────┘ │ └──────────┘ │ │ │ │ │ └─────┬────┘ └────┬─────┘ │ │ ▼ ▼ ┌──────────────┐ ┌──────────────┐ │ 需推理/搜索? │ │ 需自进化? │ └──────┬───────┘ └──────┬───────┘ ┌──┴──┐ ┌──┴──┐ │ │ │ │ ▼ │ ▼ │ ┌────────┐ │ ┌────────┐ │ │ Gemini │ │ │ Hermes │ │ │(搜索) │ │ │(小七) │ │ │ChatGPT │ │ └────────┘ │ │(推理) │ │ │ │ └────────┘ │ │ │ │ │ │ │ └──┬──┘ └──┬───┘ │ │ ▼ ▼ ┌─────────────┐ ┌─────────────┐ │ 需IDE/全栈? │ │ 需自动化? │ └──────┬──────┘ └──────┬──────┘ │ │ ┌──┴──┐ ┌──┴──┐ │ │ │ │ ▼ │ ▼ │ ┌────────┐ │ ┌────────┐ │ │ Trae │ │ │OpenClaw│ │ │(3号) │ │ │(心跳) │ │ └────────┘ │ └────────┘ │ │ │ │ │ └──┬──┘ └──┬───┘ │ │ ▼ ▼ ┌──────────────┐ ┌──────────────┐ │ 路由到文/武 │ │ 路由到苦力 │ │ 官智能体 │ │ (纯Py脚本) │ └──────────────┘ └──────────────┘ ``` ### 10.5 具体场景路由示例 | 任务类型 | 路由到 | 原因 | |:---------|:-------|:------| | **修 Bug** | Codex (5号) | 编程能力最强 | | **写新功能/重构** | Codex (5号) | Terminal-Bench 82.7% | | **代码审查** | Trae IDE (本机) | 内置代码审查 | | **搜索研究竞品** | Gemini (网页) | Deep Research 最强 | | **写文案/润色** | ChatGPT/ Gemini | 推理+写作强 | | **飞书通知Boss** | Hermes (4号蚁后) | Webhook → 飞书 | | **消息入口/客服** | OpenClaw (4号) | 50+ 平台覆盖 | | **定时巡检/监控** | OpenClaw (4号) | Heartbeat 原生 | | **数据库/ETL** | 糖糖 (2号) | 已部署金融中台 | | **大规模生图** | 蚁后 (4号) | 可灵AI流水线 | | **UI设计/打标签** | 小七 (3号) | 视觉+本地AI | | **日志分析/归档** | 小马 (5号) | 看板+定时任务 | | **AI IDE 全栈开发** | Trae IDE (本机) | SOLO/Work 全自动 | | **长文档分析** | Gemini (网页) | 100万token | | **子任务并行执行** | Hermes delegate_task | 并行3个子代理 | | **环境急救** | Codex (5号) | app-server daemon | | **纯重复操作** | 苦力Py脚本 | 不走LLM,不死不休 | --- ## 11. 蚂蚁军团路由决策矩阵 ### 11.1 主核: Trae IDE (本机 3号) | 条件 | 动作 | |:-----|:------| | 本机开机 | Trae 担任主帅,拆解所有任务 | | 本机关机 | **蚁后 (4号)** 云端代拆 | | Trae 和蚁后都不可用 | ⚠️ 紧急兜底 — 飞书通知 Boss | ### 11.2 文官路由 | 条件 | 路由到 | |:-----|:-------| | 需要视觉分析/UI设计/语音 | **小七** (Hermes 3号 + qwen3.5视觉) | | 需要定时巡检/日志分析/json校验 | **小马** (Hermes 5号) | | 需要自进化/自我改进 | **小七** (Hermes 唯一具备) | | 需要多Agent通信 | **Hermes** Webhook (任意实例) | ### 11.3 武官路由 | 条件 | 路由到 | |:-----|:-------| | 需要编程 (修Bug/写代码/重构) | **Codex** (5号, v0.137.0 + GPT-5.5) | | 需要大规模生图 (可灵AI) | **蚁后** (4号, 夜间流水线) | | 需要商品卡/海报设计(含精准文字渲染) | **Gemini Nano Banana** (云端, 可14张参考图+精准文字) | | 需要金融数据 (爬虫/ETL/向量库) | **糖糖** (2号, 完全自治) | | 需要浏览器CDP操作 | **Codex** (5号, browser_use) | | 需要DOM提取/selectors | **Codex** (5号, 比Python脚本快) | | 需要商品库维护 | **蚁后** (4号) | | 需要代码/环境急救 | **Codex** (5号, app-server daemon) | ### 11.4 云工具路由 | 条件 | 路由到 | |:-----|:-------| | 需要深度搜索 (竞品/市场研究) | **Gemini** Deep Research | | 需要创意写作/多版本文案 | **ChatGPT** Canvas | | 需要长文档分析 (100万token) | **Gemini** (付费) | | 需要多模态分析 (图像/音频/视频) | **Gemini** (原生多模态最强) | | 需要代码解释 (数据分析) | **ChatGPT** Code Interpreter | | 需要强推理 (复杂数学/逻辑) | **ChatGPT** GPT-5.5 Pro | | 需要 Apps 生态 (Canva/Figma等) | **ChatGPT** Apps (MCP协议) | | **需要 Google Drive 文件操作** (读目录/改文件/传图片) | **ChatGPT** Apps MCP (替代5hao rclone) | ### 11.5 苦力路由 | 条件 | 路由到 | |:-----|:-------| | 纯重复操作 (不需要LLM) | 纯Py脚本 (不走LLM, 不死不休) | | 批量文件处理/格式转换 | 纯Py脚本 | | 定时数据库备份 | Cron + Shell脚本 | | 批量下载/上传 | Python + CDP | | 数据清洗/转换 | 纯Py脚本 (pandas) | ### 11.6 紧急兜底规则 ``` if 主核(Trae)不可用: if 备核(蚁后)可用: → 蚁后代拆 else: → 飞书通知Boss "路由系统双核均不可用" → 等待人工介入 if 武官(Codex)修复3次仍失败: → 收集现场证据 (日志/截图/DOM) → 写清楚的文档 → 派活给Codex自己 (它自己修自己) → 如果还是不行, 人工介入 if 文官(小马)发现异常: → 暂停当前任务 → 飞书请示Boss → 获批后才派Codex修 → 小马只看不修 ``` --- ## 12. 异常修复链路 ### 12.1 标准工作流 ``` ① 报错触发 ↓ ② 截图 + DOM 提取 (Codex) ↓ ③ 丢看板 (Hermes Kanban) ↓ ④ 小马 (监军) 暂停任务 → 飞书请示 Boss ↓ ⑤ Boss 批准 → 派 Codex 修 ↓ ⑥ 修完 → 恢复任务 → 归档 ``` ### 12.2 谁负责什么 | 角色 | 职责 | 工具 | |:-----|:------|:------| | **小马** (监军) | 发现异常 → 暂停 → 飞书请示 | Hermes Webhook → 飞书 | | **Codex** (武教头) | 收到批准 → 修 | Codex CLI v0.137.0 | | **Trae** (主帅) | 审批+记录 | Trae IDE (本机) | | **小七** (文官) | 视觉检查/内容审核 | Hermes + qwen3.5-vision | ### 12.3 3次修不好流程 ``` if 修复尝试 > 3次: 1. 停手 — 不再绕圈子 2. 收集现场: 日志 + 错误信息 + 环境快照 3. 写清楚文档给 Codex 4. Codex 直接 SSH 到目标服务器修 (效率最高) 5. 修完记日记到 ant-backups/ ``` --- ## 附录 ### A. 文档维护 | 操作 | 负责人 | 频率 | |:-----|:-------|:------| | 更新工具版本 | Trae | 每月 | | 更新能力标签 | Trae | 季度 | | 路由规则调整 | Trae + 蚁后 | 按需 | | 归档备份 | 小马 | 每6小时 | ### B. 关联文档 | 文档 | 路径 | |:-----|:------| | 蚂蚁帝国架构总图 | `.trae/rules/server_infrastructure.md` | | Hermes 完整参考 | `ant-backups/knowledge-base/工具篇/HERMES-COMPLETE-REFERENCE.md` | | Codex CLI 参考 | `ant-backups/knowledge-base/工具篇/OPENAI-CODEX-COMPLETE-REFERENCE.md` | | 路由系统详细设计 | `.trae/rules/server_infrastructure.md#11` | | 本地 AI 资产清单 | `.trae/rules/local-assets.md` | ### C. 更新日志 | 日期 | 版本 | 变更 | |:-----|:-----|:------| | 2026-06-21 | v1.0 | 首次创建,6工具全景能力分析 + 路由互补矩阵 |