# ChatGPT / GPT-5.5 原始搜索结果 > 最后更新: 2026-06-21 > 说明: 本文件为联网搜索结果的原始汇总,未经精炼,仅做事实整理和分类归档。 > 来源: WebSearch × 多轮查询 --- ## 一、GPT-5.5 发布概况 ### 1.1 发布日期 | 事件 | 日期 | 详情 | |:---|:-----|:------| | **GPT-5.5 正式发布** | 2026-04-23 | OpenAI 官方公告 "Introducing GPT-5.5" | | **API 开放** | 2026-04-24 | gpt-5.5 + gpt-5.5-pro 可通过 API 调用 | | **内部代号** | — | "Spud"(薯仔/土豆),Axios 等多家可靠信源确认 | | **ChatGPT 默认模型替换** | 2026-05-05 | GPT-5.5 Instant 取代 GPT-5.3 Instant 成为 ChatGPT 全平台默认模型 | | **定位** | — | "a new class of intelligence for real work"(Greg Brockman 语) | ### 1.2 发布背景 GPT-5.5 是 OpenAI 自 GPT-4.5 以来**首个完全重新训练的基础模型**(ground-up retrain),而非 GPT-5 系列的简单微调增量更新。距离上一版本 GPT-5.4(2026-03-05 发布)仅间隔 6 周。 同期竞争格局: - **Claude Opus 4.7**: Anthropic 于 2026-04-16 发布 - **Gemini 3.1 Pro Preview**: Google 同期发布 - **DeepSeek V4**: 2026-04-24 发布(GPT-5.5 后第二天) - **Grok 4.20 (Reasoning)**: xAI 同期 ### 1.3 GPT-5 系列完整发布时间线 | 模型/产品 | 发布日期 | 关键亮点 | |:---------|:---------|:---------| | GPT-5 | 2025-08-07 | 统一 GPT-5 系统,合幷 GPT-4o 和 o-series | | Codex | 2025-05-16 | 云端软件工程 agent | | o3 / o4-mini | 2025-04-16 | 推理模型+工具使用 | | GPT-4.1 | 2025-04-14 | API 模型系列 | | 4o image gen | 2025-03-25 | GPT-4o 原生图像生成 | | GPT-4.5 | 2025-02-27 | 大模型研究预览 | | GPT-5.1 | 2025-11-12 | Instant + Thinking 双模式 | | GPT-5.2 | 2025-12-11 | 专业知识工作和长期 agent | | GPT-5.2-Codex | 2025-12-18 | 复杂软件工程+防御性安全 | | GPT-5.3-Codex | 2026-02-05 | 专业 agentic 编程 | | GPT-5.3-Codex-Spark | 2026-02-12 | 超快实时编程研究预览 | | GPT-5.4 | 2026-03-05 | 推理/编程/agent/工具前沿模型 | | GPT-5.4 mini/nano | 2026-03-17 | 更快更低成本的小型模型 | | **GPT-5.5** | **2026-04-23** | **前沿模型:编程、研究、电脑操作** | | GPT-5.5 Pro | 2026-04-23 | 更高精度版 | | ChatGPT Images 2.0 | 2026-04-21 | 新图像生成体验 | --- ## 二、模型矩阵与定价 ### 2.1 ChatGPT 用户端模型分层 GPT-5.5 在 ChatGPT 上拆分为三个层级(Instant / Thinking / Pro),取代之前的 GPT-5.3 Instant: | 名称 | 本质 | 适用场景 | 速度/成本 | 可用性 | |:----|:-----|:---------|:---------|:-------| | **GPT-5.5 Instant** | 默认高速模式,自动切换系统 | 日常 Q&A、写作、摘要、简单编程 | 最快、配额效率最高 | 所有层级(免费版有限制) | | **GPT-5.5 Thinking** | 深度推理模式,手动选择 | 复杂推理、长上下文分析、疑难编程、研究 | 较慢但推理稳定 | 付费用户手动选择 | | **GPT-5.5 Pro** | 最高强度研究级模式 | 高风险/高精度任务:法律、商业、数据科学 | 最慢最重但质量最高 | Pro/Business/Enterprise/Edu | **Instant 自动切换机制**:当用户选择 Instant 时,ChatGPT 可以自动判断需要 Instant 还是 Thinking。对于复杂任务,Instant 可能自动切换到 Thinking 模式进行更深入推理。 **Thinking 模式特点**: - 开始推理前可显示简短前言说明计划 - 用户可在模型思考时添加指令引导方向 - 输出更精炼,格式更清晰 - 可设置"思考投入程度"(reasoning effort) **Pro 限制**:不提供 Apps(应用)、Memory(记忆)、Canvas(画布)和图像生成。 ### 2.2 ChatGPT 各层级上下文窗口 | 模式 | 免费版 | Plus/Business | Pro/Enterprise | |:----|:------|:-------------|:--------------| | **Instant** | 16K | 32K | 128K | | **Thinking (手动选择)** | — | 256K(128K输入+128K最大输出) | 400K(272K输入+128K最大输出) | | **API** | — | — | 1M tokens | ### 2.3 各层级使用限制 | 层级 | 限制 | |:----|:-----| | **免费版** | 5小时窗口内有限使用 GPT-5.5;限制动态调整 | | **Plus / Go** | 每3小时最多 160 条消息;到达后切换到 mini 版 | | **Thinking (Plus/Business)** | 手动选择,Plus/Go 每5小时最多 10 条 Thinking 消息 | | **Pro** | 部分模型有单独配额;达到后暂时不可用直到重置 | ### 2.4 API 定价(OpenAI 官方) | 模型 | 输入 (per 1M tokens) | 输出 (per 1M tokens) | 缓存输入 | |:----|:--------------------|:---------------------|:--------| | **GPT-5.5** | $5.00 | $30.00 | $0.50 | | **GPT-5.5 Pro** | $30.00 | $180.00 | N/A | | **GPT-5.4** | $2.50 | $15.00 | $0.25 | | **GPT-5.4 mini** | $0.75 | $4.50 | $0.075 | > GPT-5.5 标准 API 定价相比 GPT-5.4 **上涨了 2 倍**($2.50→$5 / $15→$30)。 #### API 处理层级别定价 | 层级 | 输入 ($/MTok) | 输出 ($/MTok) | 倍率 | 延迟特征 | |:----|:-------------|:-------------|:-----|:--------| | **Batch API** | $2.50 | $15.00 | 0.5× | ≤24h 异步 | | **Flex** | $2.50 | $15.00 | 0.5× | Best-effort,可能有队列 | | **Standard** | $5.00 | $30.00 | 1× | <2s 首 token | | **Priority** | $12.50 | $75.00 | 2.5× | 保证低延迟、吞吐量下限 | | **Codex Fast** | $12.50 | $75.00 | 2.5× cost, 1.5× speed | 最快同步,Codex IDE only | > **关键发现**:GPT-5.5 Batch/Flex 价格($2.50/$15)与 GPT-5.4 Standard 价格完全相同——意味着如果你能容忍异步处理,可以用 GPT-5.4 的价格跑 GPT-5.5。 #### Thinking 模式的 Token 消耗倍数 | reasoning.effort | 输出 Token 倍数 | 适用场景 | |:----------------|:---------------|:---------| | `low` (默认) | 1× | 大多数例程调用 | | `medium` | 1.3–2× | 多步编程、结构化生成 | | `high` | 2–4× | 深度研究、正确性关键检查 | | `xhigh` | 3–8× | Agent 循环+工具链、密集规划 | ### 2.5 ChatGPT 订阅方案价格 | 方案 | 月费 | GPT-5.5 访问 | |:----|:-----|:-------------| | **Free** | $0 | 有限使用 GPT-5.5 Instant | | **Go** | 入门级 | Instant + 有限 Thinking(每5h 10条) | | **Plus** | $20/mo | Instant + Thinking | | **Pro** | $200/mo | Instant + Thinking + Pro | | **Business** | 按席位 | Instant + Thinking + Pro | | **Enterprise / Edu** | 定制 | 全部 | --- ## 三、基准测试数据 ### 3.1 综合排名 | 排行榜 | 排名 | 分数 | |:------|:----|:-----| | BenchLM 临时排行榜(Provisional) | **#8 / 124** | 89/100 | | BenchLM 验证排行榜(Verified) | **#7 / 33** | — | | Chatbot Arena Elo(总评) | **1474** | ±5.0,25,255 票 | | Chatbot Arena 编程 | 1502 | ±8.1,7,056 票 | | Chatbot Arena 数学 | 1489 | ±16.4,1,409 票 | | Chatbot Arena 指令遵循 | 1472 | ±7.5,8,497 票 | | Chatbot Arena 创意写作 | 1448 | ±10.1,4,293 票 | | Chatbot Arena 多轮对话 | 1478 | ±9.8,4,395 票 | | Chatbot Arena 困难提示 | 1492 | ±6.0,16,527 票 | | Artificial Analysis Intelligence Index v4.0 | **#1** | 60 分(领先 Claude Opus 4.7 和 Gemini 3.1 Pro 各3分) | ### 3.2 Agentic(智能体)— 最强类别,#4 排名 | 基准测试 | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 | |:--------|:--------|:--------|:----------------| | **Terminal-Bench 2.0** | **82.7%** | ~75.1% | 69.4% | | **OSWorld-Verified** | **78.7%** | ~75.0% | 78.0% | | **GDPval (44 职业)** | **84.9%** | 83.0% | 80.3% | | **Tau2-bench Telecom** | **98.0%** | — | — | | **BrowseComp** | 84.4% | 82.7% | 79.3% | | **SWE-bench Pro** | 58.6% | 57.7% | **64.3%** | | **Expert-SWE (内部评估)** | **73.1%** | 68.5% | — | | 投资银行建模 | **88.5%** | 87.3% | — | - **Agentic 类别综合分数**: 95.9/100(权重22%,12个基准测试) - **终端操作**: 超越人类专家基准(72.4%) - **GDPval 含义**: 跨44个职业的知识工作基准测试 ### 3.3 Coding(编程) | 基准测试 | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 | |:--------|:--------|:--------|:----------------| | **SWE-bench Verified** | **88.7%** | 82.1% | 87.6% | | **SWE-bench Pro** | 58.6% | — | **64.3%** | | **Expert-SWE** | **73.1%** | 68.5% | — | - **编程类别综合分数**: 82.6/100(权重20%,8个基准测试) ### 3.4 Reasoning(推理) | 基准测试 | GPT-5.5 | 说明 | |:--------|:--------|:-----| | **MuSR** | — | 多步推理 | | **LongBench v2** | — | 长上下文推理 | | **MRCR v2** | **74.0%** (512K-1M) | 检索式推理,大幅领先 Claude Opus 4.7(32.2%) | | | **87.5%** (256K-512K) | 同样远高于 Opus 4.7(59.2%) | | **ARC-AGI-2** | — | 抽象推理 | - **推理类别综合分数**: 96.3/100(权重17%,5个基准测试) ### 3.5 Knowledge(知识) | 基准测试 | GPT-5.5 | |:--------|:--------| | **MMLU** | **92.4%**(vs GPT-4 的 86.4%) | | **GPQA** | — | | **SuperGPQA** | — | | **MMLU-Pro** | — | | **HLE(Humanity's Last Exam,无工具)** | —(Claude Opus 4.7 以 46.9% 保持领先) | | **FrontierScience** | — | | **SimpleQA** | — | - **知识类别综合分数**: 95.6/100(权重12%,10个基准测试) ### 3.6 Math(数学) | 基准测试 | GPT-5.5 | |:--------|:--------| | **AIME 2025** | — | | **BRUMO 2025** | — | | **MATH-500** | — | | **FrontierMath** | — | - **数学类别综合分数**: 96.4/100(权重5%,1个基准测试) ### 3.7 Multimodal(多模态) | 基准测试 | GPT-5.5 | Claude Opus 4.7 | |:--------|:--------|:----------------| | **MMMU-Pro** | — | — | | **OfficeQA Pro** | — | — | | **CharXiv** | — | — | | **CharXiv w/o tools** | — | — | - **多模态类别综合分数**: 58.0/100(权重12%,5个基准测试) - **排名: #59** — GPT-5.5 的最弱类别 ### 3.8 法律领域评估(Harvey AI) | 指标 | GPT-5.5 | GPT-5.4 | |:----|:--------|:--------| | **BigLaw Bench** | **91.7%** | 91.0% | | 完美分数任务占比 | **43%** | — | | <0.50 分数任务 | **0** | — | | 强项 | 风险评估、交易管理、诉讼文件分析 | — | ### 3.9 科学研究 | 基准测试 | GPT-5.5 | GPT-5.4 | |:--------|:--------|:--------| | **GeneBench**(多阶段遗传学+定量生物学分析) | **25.0%** | 19.0% | --- ## 四、核心架构改进 ### 4.1 原生全模态架构(Native Omnimodal) GPT-5.4 通过适配器层(adapter layers)将图像处理能力搭接在文本基础模型上;GPT-5.5 拥有**统一架构**,通过同一参数池处理文本、图像、音频和视频——类似于 Gemini 1.5 的方法,但采用了 OpenAI 的扩展方式。 ### 4.2 Token 效率提升 - **40-72% 更少的输出 Token** 完成相同 Codex 任务(OpenAI 自报 40%,第三方测试在结构化提取任务中更高) - 同样延迟(与 GPT-5.4 相同的每 token 服务延迟),但 Token 使用量大幅降低 - **Token 效率是价格翻倍的核心理由**——每任务实际成本仅增加约 20%,而非 100% ### 4.3 幻觉率(Hallucination)数据 **关键矛盾点**:GPT-5.5 在 Agentic 基准测试上领先,但在幻觉方面存在重大问题。 | 测量方式 | GPT-5.5 | 对比 | |:--------|:--------|:-----| | **OpenAI 自报** | **幻觉减少 60%** vs GPT-5.4 | 自报,待第三方验证 | | **OpenAI 自报 (Instant 版)** | 高危领域(医学/法律/金融)**减少 52.5%** 幻觉断言 vs GPT-5.3 Instant | 内部基准 | | **用户标记对话中的不准确断言** | **减少 37.3%** | 实际用户数据 | | **AA-Omniscience 幻觉率**(独立第三方) | **86%** | 最严重问题 | | **AA-Omniscience 准确率** | **57%**(史上最高) | — | | **AA-Omniscience 指数** | **20/100** | — | **对比对手**(AA-Omniscience 基准): | 模型 | 准确率 | 幻觉率 | AA-Omniscience Index | |:----|:------|:-------|:--------------------| | **GPT-5.5 (xhigh)** | **57%** | **86%** | **20** | | **Claude Opus 4.7** | ~45% | **36%** | **26** | | **Gemini 3.1 Pro Preview** | ~56% | 50% | **33** | | **Grok 4.20 (Reasoning)** | ~47% | **17%** | N/A | **AA-Omniscience 说明**: - 6,000 道题,涵盖 42 个经济相关主题(商业、人文、健康、法律、软件工程、STEM) - 测试模型能否区分"知道"和"猜测" - 幻觉率 = 模型自信给出错误答案的频率 - GPT-5.5 的特点是:比任何模型知道得多,但也是最不愿意承认不知道的 **结构性问题**:GPT-5.5 的 14 分准确率提升几乎全部来自"知道更多事实",而非"减少幻觉"。过度自信问题与之前版本基本未变。 ### 4.4 长上下文检索 | 上下文长度 | GPT-5.5 | Claude Opus 4.7 | |:----------|:--------|:----------------| | **256K–512K** | **87.5%** | 59.2% | | **512K–1M** | **74.0%** | 32.2% | ### 4.5 训练数据 - Knowledge cutoff: **2025-12-01** --- ## 五、ChatGPT 功能拆解 ### 5.1 Canvas(画布) **发布时间**: 2024-10-03 **最新状态**: 支持 Web、Windows、MacOS;即将支持移动端 **Pro 模式不支持**: Canvas 不适用于 pro-series 模型 Canvas 是 ChatGPT 中用于写作和编程的**专用协作编辑器界面**,与标准聊天的区别: | 特性 | 标准聊天 | Canvas | |:----|:--------|:-------| | 界面 | 单列聊天 | 左侧聊天 + 右侧独立工作区 | | 编辑方式 | AI 全量重写 | 用户可直接编辑文字/代码 | | 选区操作 | 无 | 高亮特定段落→针对性反馈 | | 版本管理 | 无 | 返回按钮还原历史版本 | | 上下文理解 | 有限 | AI 能完整看到画布中的文档 | **Canvas 写作快捷键**: - **Suggest Edits**(建议编辑):AI 加入行内建议 - **Adjust Length**(调整长度):缩短或扩写 - **Change Reading Level**(改变阅读水平):Kindergarten 到 Graduate School - **Add Final Polish**(最终润色):检查流畅度、术语一致性、风格 - **Add Emojis**(添加表情符号) **Canvas 编程快捷键**: - **Add Logging**(添加日志):自动插入 print/log 语句 - **Add Comments**(添加注释) - **Fix Bugs**(修复 Bug) - **Port to Other Languages**(移植到其他语言):JS/TS/Python/Java/C++/PHP - **Code Review**(代码审查):内联优化建议 **Canvas 高级功能**: - **Python 代码执行**:在 Canvas 中直接运行 Python 代码,查看输出和错误 - **React/HTML 沙盒渲染**:构建小型交互式应用和 React 组件 - **代码网络访问控制**:Enterprise 可控制 Canvas 代码执行和网络访问 **Canvas 启动方式**: 1. 自动触发:ChatGPT 检测到 10 行以上输出或适合写作/编程的场景 2. 手动:提示词中加入"使用 canvas..." 3. 命令:输入 `/canvas` 或从工具箱中选择 ### 5.2 Code Interpreter(代码解释器) - 集成在 Canvas 中 - 支持 Python 代码的浏览器内直接执行 - 可进行数据分析、脚本编写、快速原型开发 - Enterprise 工作区可控制代码执行和网络访问开关 ### 5.3 ChatGPT Tools(工具支持) | 工具 | GPT-5.5 Thinking | GPT-5.5 Instant | |:----|:-----------------|:----------------| | **Web Search**(网络搜索) | ✅ | ✅ | | **Canvas**(画布) | ✅ | ✅ | | **Memory**(记忆) | ✅ | ✅(不适用于 Pro) | | **Image Generation**(图像生成) | ✅ | ✅(不适用于 Pro) | | **Apps**(应用/插件) | ✅ | ✅(不适用于 Pro) | | **Data Analysis**(数据分析) | ✅ | ✅ | | **Code Execution**(代码执行) | ✅ | ✅ | | **Vision**(视觉识别) | ✅ | ✅ | ### 5.4 GPT-5.5 Instant 新特性(2026-05-05 默认模型更新) 1. **目标导向提示(Goal-Based Prompting)**: - 用户直接描述期望结果,AI 自动生成简洁的定制响应 - 无需传统逐步提示 - 例如"总结这份法律文件的争议焦点"而非分步提问 2. **简洁性提升**: - 比 GPT-5.3 Instant 少用 **30.2% 的词汇** 和 **29.2% 的行数** - 减少过度格式化、过多 emoji 和不必要的追问 3. **记忆透明度(Memory Sources)**: - 用户可以查看、编辑和管理存储的上下文 - 个性化体验更可控 4. **STEM 表现飞跃**: - 技术推理能力显著提升 ### 5.5 ChatGPT 其他重要功能 - **ChatGPT Search**(2024-10-31):ChatGPT 内部的网络搜索体验 - **实时语音 Agent**:实时对话能力 - **70 种语言实时翻译**:新翻译功能 - **Microsoft Office 集成**:GPT-5.5 Instant 支持 Office 工具联动 --- ## 六、竞争对手对比 ### 6.1 四家旗舰模型对比(2026年4月) | 指标 | GPT-5.5 (xhigh) | Claude Opus 4.7 | Gemini 3.1 Pro Preview | Grok 4.20 (Reasoning) | |:----|:----------------|:----------------|:----------------------|:---------------------| | **Terminal-Bench 2.0** | **82.7%** | 69.4% | ~69% | N/A | | **SWE-Bench Pro** | 58.6% | **64.3%** | ~55% | N/A | | **AA-Omniscience 准确率** | **57%** | ~45% | ~56% | ~47% | | **AA-Omniscience 幻觉率** | **86%** | **36%**(最低) | 50% | **17%**(最低) | | **AA-Omniscience Index** | 20 | 26 | **33**(最佳校准) | N/A | | **GDPval-AA (Elo)** | **~1,785** | 1,753 | ~1,315 | N/A | | **API 输入/输出 (per 1M)** | $5 / $30 | $5 / $25 | 更低 | $2 / $6 | | **上下文窗口** | 1M tokens | 1M tokens | 1M tokens | 2M tokens | | **Intelligence Index v4.0** | **60**(#1) | 57 | 57 | — | ### 6.2 各模型相对优势 | 领域 | 领先模型 | |:----|:---------| | **Agentic / 电脑操作** | GPT-5.5 | | **编程 (SWE-Bench Pro)** | Claude Opus 4.7 | | **编程 (SWE-Bench Verified)** | GPT-5.5 | | **精确性/低幻觉** | Grok 4.20 → Claude Opus 4.7 | | **校准度 (知道何时不说)** | Gemini 3.1 Pro Preview | | **多语言** | Claude/Gemini 可能领先 | | **知识面/准确率** | GPT-5.5 | | **性价比** | Grok 4.20($2/$6 对 $5/$30) | | **HLE(无工具)** | Claude Opus 4.7(46.9% 保持领先) | ### 6.3 用途别推荐 | 用途 | 推荐模型 | |:----|:---------| | 编程代 agent | GPT-5.5(Terminal-Bench 领先) | | 复杂软件工程 | Claude Opus 4.7(SWE-Bench Pro 领先) | | 长文档分析 | GPT-5.5(MRCR v2 大幅领先) | | 法律/医疗等高风险领域 | Claude Opus 4.7 / Grok 4.20(幻觉率低) | | 日常对话 | GPT-5.5 Instant 或 GPT-5.4 mini | | 批量离线处理 | GPT-5.5 Batch(GPT-5.4 的价格,GPT-5.5 的质量) | | 预算有限 | Grok 4.20 或 GPT-5.4 mini | --- ## 七、弱项与局限 ### 7.1 确认的弱项 1. **高幻觉率** — AA-Omniscience 86%,远高于 Claude Opus 4.7(36%)和 Grok 4.20(17%) 2. **多模态表现一般** — 多模态类别排名 #59,综合分数 58.0/100 3. **价格翻倍** — $5/$30 vs GPT-5.4 的 $2.50/$15 4. **SWE-Bench Pro 不及 Claude** — 58.6% vs 64.3% 5. **HLE(无工具)不及 Claude** — Claude Opus 4.7 以 46.9% 维持领先 6. **部分多语言评估(MMMLU)** — Claude/Gemini 保持优势 ### 7.2 产品反馈中的争议 - 部分用户认为 GPT-5.5 在日常写作方面不如 GPT-4 时代模型 - 过度自信问题在前版本基础上基本未变 - 对于"告诉 AI 该做什么"的任务,GPT-5.5 需要更简洁、目标导向的提示 --- ## 八、其他信息 ### 8.1 GPT-5.5-Cyber(网络安全专用变体) GPT-5.5 系列中有一个专门的网络安全变体「GPT-5.5-Cyber」,专为网络安全专业人士设计: - 防御性安全任务 - 安全代码分析 - 威胁检测与响应 ### 8.2 与 DeepSeek V4 的竞争 - DeepSeek V4 在 GPT-5.5 发布后第二天(2026-04-24)发布 - DeepSeek V4 定价远低于 OpenAI:传闻 $0.30/$0.50 - 预计将引发价格战 ### 8.3 Knowledge Cutoff - GPT-5.5 的知识截止日期:**2025-12-01** ### 8.4 商用使用与许可 - GPT-5.5 可用于商业用途 - API 用户受 OpenAI 使用条款约束 - Enterprise 工作区管理员可控制数据驻留和区域处理 - ChatGPT Business/Enterprise 提供数据不用于训练的选项 --- ## 九、来源链接 - [OpenAI 官方公告 - Introducing GPT-5.5](https://openai.com/index/introducing-gpt-5-5/) - [OpenAI API 定价页面](https://openai.com/zh-Hans-CN/api/pricing/) - [OpenAI Help Center - ChatGPT 中的 GPT-5.5](https://help.openai.com/zh-hant/articles/11909943-gpt-53-and-gpt-54-in-chatgpt) - [OpenAI Help Center - Canvas 功能说明](https://help.openai.com/zh-hant/articles/9930697-what-is-the-canvas-feature-in-chatgpt-and-how-do-i-use-it) - [BenchLM.ai - GPT-5.5 基准排名](https://benchlm.ai/models/gpt-5-5) - [TokenMix.ai - GPT-5.5 Review (88.7% SWE-Bench, 92.4% MMLU)](https://tokenmix.ai/blog/gpt-5-5-spud-review-88-swe-bench-2026) - [TokenMix.ai - GPT-5.5 Batch vs Flex vs Priority 定价](https://tokenmix.ai/blog/gpt-5-5-batch-flex-priority-pricing-2026) - [AI2.Work - GPT-5.5 Tops Agentic Benchmarks but Flags 86% Hallucination Rate](https://ai2.work/blog/gpt-5-5-tops-agentic-benchmarks-but-flags-an-86-hallucination-rate) - [AI Workflows - GPT-5.5 Review: Benchmarks, Agentic Capabilities & Verdict](https://aiworkflows.tools/blog/gpt-5-5-review-benchmarks-features-2026) - [ChatGPT AI Hub - GPT-5.5 Complete Guide](https://chatgptaihub.com/gpt-5-5-complete-guide-benchmarks-features-comparison/) - [ChatGPT AI Hub - GPT-5.5 Instant Default Model Changes May 2026](https://chatgptaihub.com/gpt-5-5-instant-default-chatgpt-model-changes-may-2026/) - [ChatGPT AI Hub - GPT-5 to GPT-5.5 Side-by-Side Comparison](https://chatgptaihub.com/gpt-5-to-gpt-5-5-side-by-side-every-capability-difference-across-5-5-1-5-2-5-3-5-4-5-4-cyb/) - [ScriptByAI - OpenAI & ChatGPT Timeline](https://www.scriptbyai.com/timeline-of-chatgpt/) - [AI Wiki - GPT-5 完整发布历史](https://aiwiki.ai/wiki/gpt-5) - [DevBriefs - 7 Key GPT-5 Release Changes](https://devbriefs.com/gpt-5-release-changes-model-lineup-sdk-breaking/) - [Geeky Gadgets - ChatGPT 5.5 Instant Update](https://www.geeky-gadgets.com/chatgpt-5-5-instant-update/) - [APIdog - GPT-5.5 Pricing (德语)](https://apidog.com/de/blog/gpt-5-5-pricing/) - [Qiita - GPT-5.5 Thinking/Pro/API 公式情报整理 (日语)](https://qiita.com/Tadataka_Takahashi/items/8c9590b14200fb43545d) - [AIpedia - GPT-5.5 完全ガイド (日语)](https://ai-pedia.jp/guides/gpt-5-5-complete-guide/) - [AIsmiley - GPT-5.5 彻底解説 (日语)](https://aismiley.co.jp/ai_news/gpt-5-5-about/) - [Knightli - GPT-5.5 Instant/Thinking/Pro 差异 (日语)](https://www.knightli.com/ja/2026/05/07/gpt-5-5-instant-thinking-pro-differences/) - [APIYI - GPT-5.5 API Launch (中文)](https://help.apiyi.com/en/gpt-5-5-api-launch-apiyi-official-relay-en.html) - [Markai Code - OpenAI GPT-5.5 API Pricing Explained](https://markaicode.com/pricing/openai-api-gpt-55-pricing-cost-per-million-tokens/)