社群称 Codex 可通过内置浏览器调用 ChatGPT Pro,但“最强编程模型”说法未获证实
一则社交媒体帖文分享了一种未经官方确认的工作流:让 Codex 通过内置浏览器操作 ChatGPT Pro,并将任务拆解、代码编写和测试验证分工处理。帖文同时宣称 GPT-5.6 Pro 的编程能力明显超过其他模型。
目前可核实的材料主要来自个人经验、评测文章和二手报道。官方页面支持 GPT-5.6 Sol 在部分编程代理基准上表现突出,但没有确认“GPT-5.6 Pro”这一说法,也没有证实 Codex 能以该方式稳定调用 ChatGPT Pro。
其他评测对不同模型的结果并不一致,部分结果甚至显示 Fable 5 在特定基准或场景中更强。因此,这条消息更适合作为未经验证的使用技巧和主观评价,而不是已确认的产品能力或模型排名。
来源证据
GPT-5.6 Sol/Terra/Luna vs Claude Fable 5 全方位横评:编程能力只差3%,成本差3倍——4大维度实测告诉你该不该换_自律懒人-AI编程社区aicoding.csdn.net · supporting测了4款模型才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。 Logo 汇聚全球AI编程工具,助力开发者即刻编程。 更多推荐 · 一个 API 入口调用多个大模型:AiiOnly客户端 + CC Switch 打通 Codex AI编程流程 · VSCode Claude Code + MiMo 中转免登录完整配置教程(解决原生登录弹窗 + 模型报错) · 从零开始做一个属于自己的 Skill(保姆级教程) cover 一个 API 入口调用多个大模型:AiiOnly客户端 + CC Switch 打通 Codex AI编程流程 [avatar AI编程社区]( cover VSCode Claude Code + MiMo 中转免登录完整配置教程(解决原生登录弹窗 + 模型报错) [avatar AI编程社区]( cover 从零开始做一个属于自己的 Skill(保姆级教程) [avatar AI编程社区]( 浏览量 1017 点赞 6 收藏 0 0 分享 ### 所有评论(0) 您需要登录才能发言 ## 温馨提示:您尚未绑定手机号 立即绑定 欢迎加入社区 []( ### 自律懒人 回到 顶部 欢迎加入社区 [...] 但Fable 5也有它的护城河:SWE-Bench Verified 95.0%——这个成绩至今无人超越。而且它是真正在企业级真实GitHub Issue上验证过的能力,这点跟传统基准测试有本质区别。 再看价格:Sol比Fable 5便宜一半(输入$5 vs $10,输出$30 vs $50),Terra只要Fable 5的四分之一,Luna更是不到六分之一。 先别急着下结论——基准是一回事,真实开发场景是另一回事。下面我从4个维度逐一拆解。 ### 维度一:编程实战能力——谁写的代码能直接上线? 编程能力是我最看重的维度。光跑分没用,我跑了三个真实开发任务,让每个模型独立完成,然后人工审核代码质量。 #### 任务1:从零搭一个微服务模块 要求:FastAPI + PostgreSQL + Redis缓存 + Docker Compose部署。 GPT-5.6 Sol:自动生成了完整的目录结构。Controller、Service
網路上社群最近流傳一個小技巧 ChatGPT 5.5 or 5.6 Pro 這個版本,只出現網頁版 但是 coding 品質肉眼可見比 Codex 好,甚至比 Claude Fable 5 還好。 . 大家的感覺,架構更乾淨、邊界條件考慮更完整 不容易出現那種「看起來對但跑起來爆」的半成品 當然再加上一個很實際的好處——它不吃 Codex 的 token… | Wisely Chencn.linkedin.com · supporting網路上社群最近流傳一個小技巧 ChatGPT 5.5 or 5.6 Pro 這個版本,只出現網頁版 但是 coding 品質肉眼可見比 Codex 好,甚至比 Claude Fable 5 還好。 . 大家的感覺,架構更乾淨、邊界條件考慮更完整 不容易出現那種「看起來對但跑起來爆」的半成品 當然再加上一個很實際的好處——它不吃 Codex 的 token 額度。兩邊用的是不同的用量池。 . 以前用 ChatGPT Pro 寫代碼很麻煩 你得自己整理源碼、上傳文件、等結果出來再把代碼拿回去, 跑測試 出了問題還得手動搬運錯誤訊息 整套流程裡人類是最慢的那個環節 所以社群有一個小技巧, 讓 Codex 自己去用 ChatGPT Pro 我們利用 Codex 升級了內建瀏覽器 讓 Codex 可以幫我操作 ChatGPT Pro . 所以現在的分工變成這樣: . 1. Codex 負責理解需求、檢查倉庫、拆解任務、準備源碼 2. 打開多個 ChatGPT Pro 對話、追問和糾錯、把代碼拿回本地、跑完整測試,直到通過驗收 . ChatGPT Pro 負責深入研究、設計方案、寫代碼。 寫代碼的不負責驗證,驗證的不負責寫代碼。 . 我已經用了兩週,還蠻爽的 XD 所以又離開 Fable 5了 . 為什麼 ChatGPT Pro 網頁版 Coding 品質比 Codex 本身高? 我的研判: 第一,算力分配不同。Codex 要同時服務大量 agentic 任務,每個都涉及多輪推理和工具呼叫。ChatGPT Pro 的對話場景相對單純,每次請求分配到的推理算力可能更充裕。同一個底層模型,給更多 compute budget,結果自然不一樣 . [...] . 第二,harness 不同。Codex 的 harness 要管檔案系統、跑測試、處理 git,這些都佔 context window。ChatGPT Pro 的 harness 理論上更簡單 . 第三,這個 Pro 模式只有 web 有,也是有10% 可能,OpenAI 放一個神秘實驗性的產品在這個角落 . 而且這個分工邏輯,恰好吻合我之前拆解的 AgentOpt 論文結論:planning 用小模型,複雜任務用大模型。Codex 做的串接、拆任務、跑測試、追問糾錯,全部是 orchestration,需要的是反應快、to
GPT-5.6:隨你的抱負擴展的前沿智能openai.com · supporting## 預設高效,需要時發揮最高效能 GPT‑5.6 Sol 是我們迄今最出色的編碼模型。在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 使用「max」推理時以 80 分創下新的最先進水平,比 Fable 5 高 2.8 分,同時使用的輸出 Token 不到一半,所需時間不到一半,成本約低三分之一。這項優勢遍及整個模型系列:Terra 略高於 Fable 5,而 Luna 則超越 Opus 4.8;兩者所需時間約只有三分之一,輸出 Token 約少一半,估算成本亦約只有四分之一。它亦在 Terminal‑Bench 2.1 和 DeepSWE 上取得全新最先進成果;這些基準測試涵蓋複雜命令列工作流程,以及真實程式碼庫中的長時間跨度工程任務。 Artificial Analysis Coding Agent Index:一項獨立指數,評估編碼智能代理在實際執行、終端機使用及真實程式碼庫中的表現。 GPT‑5.6 可編寫並執行輕量程式,以協調工具、處理中間結果、監察進度,並隨工作推進選擇下一步行動。這讓大量使用工具的任務可用更少 Token、更少模型往返次數和更少指引持續推進。開發人員毋須為每個步驟編寫腳本,亦毋須將每個工具回應傳回模型;Responses API 中的 Programmatic Tool Calling(在新視窗中開啟) 可篩選大量中間資料,只保留重要內容,並在過程中調整工作流程。
一夜之间,GPT-5.6 来了,Codex 没了,Claude 急了 | 爱范儿ifanr.com · supporting当然,嘴上说得很好听,但实际操作可能又是另一回事。 编程是主战场。Sol 在 Artificial Analysis 编程智能体指数上拿到 80 分,创下新纪录,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,成本便宜约三分之一。Terminal-Bench 2.1 和 DeepSWE 上也刷新了最好成绩。 Terra 和 Luna 同样能打:Terra 在该指数上略高于 Fable 5,Luna 超过 Opus 4.8,两者耗时都只有对手三分之一左右,成本约为四分之一。 已经上手的客户开始交口称赞。Lovable 联合创始人则表示,新模型让用户构建应用的步骤少了约 25%,工具调用少 35% 到 48%,卡死的任务减少 15%。 网友这边已经玩疯了。开发者 Matt Shumer 晒出 Sol 一次性搓出来的体素版曼哈顿,精度惊人,而且这活是模型完全自主跑了将近一周干完的。 一口气打造《我的世界》,也不在话下。 ▲🔗 除了写代码,这次 OpenAI 反复强调的还有两个:设计品味和电脑操作。 官方说 GPT-5.6 在设计判断力上是「跨越式进步」,只给个大方向,它就能做出有审美、好上手的界面。 更关键的是,它会用增强后的电脑操作能力去检查自己渲染出来的成果,发现视觉和功能问题,收尾之后再交活。以前的模型是写完代码就完事,现在是写完还自己验收。 知识办公场景的提升同样显而易见。 BrowseComp 网页浏览评测上,Sol 拿下 92.2% 的新纪录;OSWorld 2.0 电脑操作评测 62.6%,超过 Opus 4.8 的同时输出 token 少了 85%。 [...] 做 PPT 这种打工人刚需,官方给了个对比案例:让模型照着参考文件更新数据,GPT-5.5 的输出丢失了母版里的关键元素,GPT-5.6 能推断出整套设计系统,然后原样套用到新内容上。 文档和表格也是同理,公式和财务模型的精度更高了。 不过吃瓜要吃全套。翻到博客最底下的评测大表格,有几处数字挺微妙: SWE-Bench Pro 上,Sol 是 64.6%,Claude Fable 5 是 80%,Anthropic 家更高档的 Mythos 5 是 80.3%。这项上 Claude 依然压着打。 FrontierMath 最难的 Ti
GPT-5.6正式发布,GPT-5.6对比Fable-5,谁是最强模型youtube.com · supporting# GPT-5.6正式发布,GPT-5.6对比Fable-5,谁是最强模型 ## AI随风 10200 subscribers 55 likes ### Description 6168 views Posted: 9 Jul 2026 GPT-5.6 正式版终于开放了,这次我直接用 Codex App 做了一轮实测。 这期主要看几个点: ✅ GPT-5.6 Sol / Terra / Luna 有什么区别 ✅ Codex App 新版本模型选择有什么变化 ✅ GPT-5.6 在 AI 编程里的表现如何 ✅ 和 Fable-5、智谱 5.2、Grok-4.5 对比谁更强 ✅ 长任务、前端效果、代码生成到底稳不稳 这次测试结果还是挺有意思的。 GPT-5.6 确实很强,尤其是长任务和复杂工作流能力,但在一些具体前端效果上,Fable-5 的表现还是更亮眼。 后面我会继续测试 GPT-5.6 在 AI 编程、Codex App、Agent 工作流里的真实表现。 00:00 引言 01:44 测试 02:10 GLM-5.2 02:50 Grok-4.5 03:13 GPT-5.6-sol 04:04 Fable-5 05:12 总结 17 comments ### Transcript:
GPT-5.6 對決 Claude Fable:完整評測與效能比較youmind.com · supporting如果你的工作是簡單的工程任務, 你可能有時會感覺不到升級。上一代模型已經足以勝任大部分此類工作。當你讓模型處理更困難的任務,或要求它一次做更多事時,你會更明顯地感受到升級。 這是我寫過最奇怪的評測,因為我對這個模型的看法在測試中途完全改變了,而這與模型本身無關。 我在 5 月 27 日獲得了 GPT-5.6 的存取權。大約兩週的時間裡,我完全被震撼了。我從早到晚都在使用它。有一段時間,我同時運行了太多目標模式,以至於在一台機器上,17 天內使用了 OpenAI 最高用量用戶月額度的 3 倍。我正在建造我認為模型無法建造的東西,而且我幾乎不用打字。 然後 Fable 發布了,我獲得了存取權,我幾乎立刻就停止了使用 GPT-5.6。 你應該了解我的背景。如果你讀過我之前的評測,你就知道我通常是 GPT 的支持者。我不怎麼做前端或 UX 工作。我主要做後端、系統和 Agent 工作,而 GPT 模型歷來在這方面對我來說更好。它們通常能完美執行我要求的修改,而不會多做其他事情。所以,當我告訴你一個 Claude 模型讓我放棄了我喜愛的 GPT 模型時,你要明白這不符合我的慣例。 讓我解釋這兩個部分:為什麼 GPT-5.6 讓我驚嘆,以及為什麼我現在幾乎不再使用它。 ### 目標模式是純粹的魔法 目標模式描述起來很簡單。你在 Codex CLI 或應用程式中輸入 /goal,給它一個帶有明確完成標準的目標,模型就會一直工作直到目標完成。當一次運行結束時,目標模式會檢查目標是否真正達成。如果沒有,它會啟動新的運行並繼續。如此重複。必要時可以持續數天。 [...] 除了 Fable 之外,GPT-5.6 是你所能使用的最佳模型。而在目標模式下運行它,是 OpenAI 有史以來推出的最佳 Agent 設定。 ### 優點 目標模式。 輸入 /goal,模型就會一直工作,直到目標真正完成。這是 OpenAI 最接近我理想工作方式的一次。 它很執著,可以運行數天來完成任務。 我最長的目標運行,針對單一目標持續了將近一週,而且大部分時間無人看管。 需要的手把手指導遠少於任何以前的 GPT 模型。 它在模糊不清的情況下能做出合理的判斷並持續前進。嘗試 GPT-5.6 後再回頭用 GPT-5.5,在這方面感覺像是一次巨大的退步。 安全相關工作確實很強,而且它比