Codex–ChatGPT Pro browser workflow is unverified, and the “strongest coding model” claim conflicts with other reviews
A social-media post describes using Codex’s built-in browser to operate ChatGPT Pro, while claiming that GPT-5.6 Pro is decisively better for coding than competing models. The workflow and the ranking are not independently established.
The available evidence is mostly anecdotal, drawn from personal reports, secondary reviews, and media summaries. An OpenAI page presents GPT-5.6 Sol as a leading coding model on selected agent benchmarks, but it does not confirm the claimed GPT-5.6 Pro designation or verify that Codex can reliably control ChatGPT Pro through its browser.
Results cited elsewhere are mixed, with some evaluations favoring Fable 5 on particular benchmarks or tasks. The post should therefore be treated as an unverified workflow suggestion and subjective assessment, not as confirmation of a product feature or a definitive model ranking.
Source evidence
GPT-5.6 Sol/Terra/Luna vs Claude Fable 5 全方位横评:编程能力只差3%,成本差3倍——4大维度实测告诉你该不该换_自律懒人-AI编程社区aicoding.csdn.net · supporting测了4款模型才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。 Logo 汇聚全球AI编程工具,助力开发者即刻编程。 更多推荐 · 一个 API 入口调用多个大模型:AiiOnly客户端 + CC Switch 打通 Codex AI编程流程 · VSCode Claude Code + MiMo 中转免登录完整配置教程(解决原生登录弹窗 + 模型报错) · 从零开始做一个属于自己的 Skill(保姆级教程) cover 一个 API 入口调用多个大模型:AiiOnly客户端 + CC Switch 打通 Codex AI编程流程 [avatar AI编程社区]( cover VSCode Claude Code + MiMo 中转免登录完整配置教程(解决原生登录弹窗 + 模型报错) [avatar AI编程社区]( cover 从零开始做一个属于自己的 Skill(保姆级教程) [avatar AI编程社区]( 浏览量 1017 点赞 6 收藏 0 0 分享 ### 所有评论(0) 您需要登录才能发言 ## 温馨提示:您尚未绑定手机号 立即绑定 欢迎加入社区 []( ### 自律懒人 回到 顶部 欢迎加入社区 [...] 但Fable 5也有它的护城河:SWE-Bench Verified 95.0%——这个成绩至今无人超越。而且它是真正在企业级真实GitHub Issue上验证过的能力,这点跟传统基准测试有本质区别。 再看价格:Sol比Fable 5便宜一半(输入$5 vs $10,输出$30 vs $50),Terra只要Fable 5的四分之一,Luna更是不到六分之一。 先别急着下结论——基准是一回事,真实开发场景是另一回事。下面我从4个维度逐一拆解。 ### 维度一:编程实战能力——谁写的代码能直接上线? 编程能力是我最看重的维度。光跑分没用,我跑了三个真实开发任务,让每个模型独立完成,然后人工审核代码质量。 #### 任务1:从零搭一个微服务模块 要求:FastAPI + PostgreSQL + Redis缓存 + Docker Compose部署。 GPT-5.6 Sol:自动生成了完整的目录结构。Controller、Service
網路上社群最近流傳一個小技巧 ChatGPT 5.5 or 5.6 Pro 這個版本,只出現網頁版 但是 coding 品質肉眼可見比 Codex 好,甚至比 Claude Fable 5 還好。 . 大家的感覺,架構更乾淨、邊界條件考慮更完整 不容易出現那種「看起來對但跑起來爆」的半成品 當然再加上一個很實際的好處——它不吃 Codex 的 token… | Wisely Chencn.linkedin.com · supporting網路上社群最近流傳一個小技巧 ChatGPT 5.5 or 5.6 Pro 這個版本,只出現網頁版 但是 coding 品質肉眼可見比 Codex 好,甚至比 Claude Fable 5 還好。 . 大家的感覺,架構更乾淨、邊界條件考慮更完整 不容易出現那種「看起來對但跑起來爆」的半成品 當然再加上一個很實際的好處——它不吃 Codex 的 token 額度。兩邊用的是不同的用量池。 . 以前用 ChatGPT Pro 寫代碼很麻煩 你得自己整理源碼、上傳文件、等結果出來再把代碼拿回去, 跑測試 出了問題還得手動搬運錯誤訊息 整套流程裡人類是最慢的那個環節 所以社群有一個小技巧, 讓 Codex 自己去用 ChatGPT Pro 我們利用 Codex 升級了內建瀏覽器 讓 Codex 可以幫我操作 ChatGPT Pro . 所以現在的分工變成這樣: . 1. Codex 負責理解需求、檢查倉庫、拆解任務、準備源碼 2. 打開多個 ChatGPT Pro 對話、追問和糾錯、把代碼拿回本地、跑完整測試,直到通過驗收 . ChatGPT Pro 負責深入研究、設計方案、寫代碼。 寫代碼的不負責驗證,驗證的不負責寫代碼。 . 我已經用了兩週,還蠻爽的 XD 所以又離開 Fable 5了 . 為什麼 ChatGPT Pro 網頁版 Coding 品質比 Codex 本身高? 我的研判: 第一,算力分配不同。Codex 要同時服務大量 agentic 任務,每個都涉及多輪推理和工具呼叫。ChatGPT Pro 的對話場景相對單純,每次請求分配到的推理算力可能更充裕。同一個底層模型,給更多 compute budget,結果自然不一樣 . [...] . 第二,harness 不同。Codex 的 harness 要管檔案系統、跑測試、處理 git,這些都佔 context window。ChatGPT Pro 的 harness 理論上更簡單 . 第三,這個 Pro 模式只有 web 有,也是有10% 可能,OpenAI 放一個神秘實驗性的產品在這個角落 . 而且這個分工邏輯,恰好吻合我之前拆解的 AgentOpt 論文結論:planning 用小模型,複雜任務用大模型。Codex 做的串接、拆任務、跑測試、追問糾錯,全部是 orchestration,需要的是反應快、to
GPT-5.6:隨你的抱負擴展的前沿智能openai.com · supporting## 預設高效,需要時發揮最高效能 GPT‑5.6 Sol 是我們迄今最出色的編碼模型。在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 使用「max」推理時以 80 分創下新的最先進水平,比 Fable 5 高 2.8 分,同時使用的輸出 Token 不到一半,所需時間不到一半,成本約低三分之一。這項優勢遍及整個模型系列:Terra 略高於 Fable 5,而 Luna 則超越 Opus 4.8;兩者所需時間約只有三分之一,輸出 Token 約少一半,估算成本亦約只有四分之一。它亦在 Terminal‑Bench 2.1 和 DeepSWE 上取得全新最先進成果;這些基準測試涵蓋複雜命令列工作流程,以及真實程式碼庫中的長時間跨度工程任務。 Artificial Analysis Coding Agent Index:一項獨立指數,評估編碼智能代理在實際執行、終端機使用及真實程式碼庫中的表現。 GPT‑5.6 可編寫並執行輕量程式,以協調工具、處理中間結果、監察進度,並隨工作推進選擇下一步行動。這讓大量使用工具的任務可用更少 Token、更少模型往返次數和更少指引持續推進。開發人員毋須為每個步驟編寫腳本,亦毋須將每個工具回應傳回模型;Responses API 中的 Programmatic Tool Calling(在新視窗中開啟) 可篩選大量中間資料,只保留重要內容,並在過程中調整工作流程。
一夜之间,GPT-5.6 来了,Codex 没了,Claude 急了 | 爱范儿ifanr.com · supporting当然,嘴上说得很好听,但实际操作可能又是另一回事。 编程是主战场。Sol 在 Artificial Analysis 编程智能体指数上拿到 80 分,创下新纪录,比 Fable 5 高 2.8 分,输出 token 不到一半,耗时不到一半,成本便宜约三分之一。Terminal-Bench 2.1 和 DeepSWE 上也刷新了最好成绩。 Terra 和 Luna 同样能打:Terra 在该指数上略高于 Fable 5,Luna 超过 Opus 4.8,两者耗时都只有对手三分之一左右,成本约为四分之一。 已经上手的客户开始交口称赞。Lovable 联合创始人则表示,新模型让用户构建应用的步骤少了约 25%,工具调用少 35% 到 48%,卡死的任务减少 15%。 网友这边已经玩疯了。开发者 Matt Shumer 晒出 Sol 一次性搓出来的体素版曼哈顿,精度惊人,而且这活是模型完全自主跑了将近一周干完的。 一口气打造《我的世界》,也不在话下。 ▲🔗 除了写代码,这次 OpenAI 反复强调的还有两个:设计品味和电脑操作。 官方说 GPT-5.6 在设计判断力上是「跨越式进步」,只给个大方向,它就能做出有审美、好上手的界面。 更关键的是,它会用增强后的电脑操作能力去检查自己渲染出来的成果,发现视觉和功能问题,收尾之后再交活。以前的模型是写完代码就完事,现在是写完还自己验收。 知识办公场景的提升同样显而易见。 BrowseComp 网页浏览评测上,Sol 拿下 92.2% 的新纪录;OSWorld 2.0 电脑操作评测 62.6%,超过 Opus 4.8 的同时输出 token 少了 85%。 [...] 做 PPT 这种打工人刚需,官方给了个对比案例:让模型照着参考文件更新数据,GPT-5.5 的输出丢失了母版里的关键元素,GPT-5.6 能推断出整套设计系统,然后原样套用到新内容上。 文档和表格也是同理,公式和财务模型的精度更高了。 不过吃瓜要吃全套。翻到博客最底下的评测大表格,有几处数字挺微妙: SWE-Bench Pro 上,Sol 是 64.6%,Claude Fable 5 是 80%,Anthropic 家更高档的 Mythos 5 是 80.3%。这项上 Claude 依然压着打。 FrontierMath 最难的 Ti
GPT-5.6正式发布,GPT-5.6对比Fable-5,谁是最强模型youtube.com · supporting# GPT-5.6正式发布,GPT-5.6对比Fable-5,谁是最强模型 ## AI随风 10200 subscribers 55 likes ### Description 6168 views Posted: 9 Jul 2026 GPT-5.6 正式版终于开放了,这次我直接用 Codex App 做了一轮实测。 这期主要看几个点: ✅ GPT-5.6 Sol / Terra / Luna 有什么区别 ✅ Codex App 新版本模型选择有什么变化 ✅ GPT-5.6 在 AI 编程里的表现如何 ✅ 和 Fable-5、智谱 5.2、Grok-4.5 对比谁更强 ✅ 长任务、前端效果、代码生成到底稳不稳 这次测试结果还是挺有意思的。 GPT-5.6 确实很强,尤其是长任务和复杂工作流能力,但在一些具体前端效果上,Fable-5 的表现还是更亮眼。 后面我会继续测试 GPT-5.6 在 AI 编程、Codex App、Agent 工作流里的真实表现。 00:00 引言 01:44 测试 02:10 GLM-5.2 02:50 Grok-4.5 03:13 GPT-5.6-sol 04:04 Fable-5 05:12 总结 17 comments ### Transcript:
GPT-5.6 對決 Claude Fable:完整評測與效能比較youmind.com · supporting如果你的工作是簡單的工程任務, 你可能有時會感覺不到升級。上一代模型已經足以勝任大部分此類工作。當你讓模型處理更困難的任務,或要求它一次做更多事時,你會更明顯地感受到升級。 這是我寫過最奇怪的評測,因為我對這個模型的看法在測試中途完全改變了,而這與模型本身無關。 我在 5 月 27 日獲得了 GPT-5.6 的存取權。大約兩週的時間裡,我完全被震撼了。我從早到晚都在使用它。有一段時間,我同時運行了太多目標模式,以至於在一台機器上,17 天內使用了 OpenAI 最高用量用戶月額度的 3 倍。我正在建造我認為模型無法建造的東西,而且我幾乎不用打字。 然後 Fable 發布了,我獲得了存取權,我幾乎立刻就停止了使用 GPT-5.6。 你應該了解我的背景。如果你讀過我之前的評測,你就知道我通常是 GPT 的支持者。我不怎麼做前端或 UX 工作。我主要做後端、系統和 Agent 工作,而 GPT 模型歷來在這方面對我來說更好。它們通常能完美執行我要求的修改,而不會多做其他事情。所以,當我告訴你一個 Claude 模型讓我放棄了我喜愛的 GPT 模型時,你要明白這不符合我的慣例。 讓我解釋這兩個部分:為什麼 GPT-5.6 讓我驚嘆,以及為什麼我現在幾乎不再使用它。 ### 目標模式是純粹的魔法 目標模式描述起來很簡單。你在 Codex CLI 或應用程式中輸入 /goal,給它一個帶有明確完成標準的目標,模型就會一直工作直到目標完成。當一次運行結束時,目標模式會檢查目標是否真正達成。如果沒有,它會啟動新的運行並繼續。如此重複。必要時可以持續數天。 [...] 除了 Fable 之外,GPT-5.6 是你所能使用的最佳模型。而在目標模式下運行它,是 OpenAI 有史以來推出的最佳 Agent 設定。 ### 優點 目標模式。 輸入 /goal,模型就會一直工作,直到目標真正完成。這是 OpenAI 最接近我理想工作方式的一次。 它很執著,可以運行數天來完成任務。 我最長的目標運行,針對單一目標持續了將近一週,而且大部分時間無人看管。 需要的手把手指導遠少於任何以前的 GPT 模型。 它在模糊不清的情況下能做出合理的判斷並持續前進。嘗試 GPT-5.6 後再回頭用 GPT-5.5,在這方面感覺像是一次巨大的退步。 安全相關工作確實很強,而且它比