Является ли Opus 5 моделью для накрутки бенчмарков? Доказательств недостаточно
Публикация в соцсетях ставит под сомнение, не оптимизирована ли Claude Opus 5 главным образом под результаты в рейтингах, и сравнивает отдельные сбои с проблемами старых моделей. Доступные материалы в основном вторичны и содержат предположения, а надежного первичного подтверждения широких заявлений нет.
Главный спор заключается не в том, может ли Opus 5 показывать высокие результаты на отдельных тестах, а в том, превращаются ли эти результаты в стабильную работу в реальных задачах. В публикациях отмечаются сильные стороны в программировании, использовании инструментов и решении незнакомых задач, но одновременно признается, что модель лидирует не во всех испытаниях.
Надежность доказательств ограничена, а некоторые сведения противоречат друг другу. В одном из видео прямо сказано, что связь внутреннего кодового имени с Opus 5 основана лишь на совпадении времени и поведения и не подтверждена Anthropic. Другие материалы сообщают о характеристиках, ценах и результатах тестов без полноценной ссылки на проверяемый первоисточник. Поэтому речь может идти о спорных заявлениях, но не о доказанном намеренном «накручивании» бенчмарков.
Для окончательной оценки нужны официальная модельная карта, воспроизводимые настройки тестов и независимые проверки на разных типах задач. Один скриншот или единичный неудачный ответ не доказывают общего падения Opus 5 до уровня GPT-3.5.
Источники
Claude Opus 5被扒光了!1511行提示词底牌全摊开 - 智源社区hub.baai.ac.cn · supporting这里的规矩是,用户没点名,绝不替他选合作方。 「我要打车」不等于「我要用某某打车」。急事也不例外,文件里明说了,「我20分钟后要用车」照样得走选择器。 全网首测,3D物理引擎来了 上线仅24小时,Opus 5不仅提示词被全网看光,各种硬核实测Demo更是层出不穷。 在许多人看来,花一半的钱,体验Fable 5级别的能力,这波「半价平替」实在太香了。 开发者Cengiz拿一款FPS游戏进行了极限测试,仅耗时1.5小时,就一次过了。 它不仅包揽了底层框架,甚至还顺手捏出了能在多人模式下对战的AI。 美中不足的是,游戏内的飞行机制还有些生硬,需要后续进一步调优。 无独有偶,AI大佬Matt Shumer仅用一个提示词,生成了一款3D射击游戏。 另一位硬核开发者,则直接用 Opus 5「手搓」了一个《火箭联盟》的克隆版,3D物理模拟的细节拉满。 Opus 5仅凭一个HTML文件,就通过纯程序化生成打造出了一个极具油画质感的世界。 它甚至完美拿捏了逼真的草地与风场物理模拟,屏幕上数百万根草叶都能随风自然摇曳。 Opus 5单板滑雪者测试,一次通过。 上线24小时,Opus 5的能力被全网测了个遍,规矩被全网抄了一遍。 前者是给用户看的,后者是给同行看的。 一份系统提示词被全网扒光,本该是场事故。 翻到最后你会发现,最值钱的不是任何一条工具参数,是那一长串「不许」。 不许多引一句,不许多记一行,不许替用户做一个决定。 24小时里,Opus 5能力的上限已经被开发者测了个遍;而它的下限,早在这3万Toke里被人一条条摁死了。 参考资料: 编辑:摩西 桃子 秒追ASI ⭐点赞、转发、在看一键三连⭐ 点亮星标,锁定新智元极速推送! 内容中包含的图片若涉及版权问题,请及时与我们联系删除 点赞 收藏 评论 分享到Link [...] 内容中包含的图片若涉及版权问题,请及时与我们联系删除 点赞 收藏 评论 分享到Link 举报反馈 样式问题 涉嫌广告 内容抄袭 内容侵权 政治相关 内容涉黄 其他 ### 评论列表 ### 评论 登录后可提问交流 沙发等你来抢 跳过 [...] 旁边另有一条管第三方合作伙伴的规则,写法恰好相反,处处防着替用户做主。商业动作和克制条款,在同一份配置文件里
「叫AI再檢查一次」反而更花錢!Claude Opus 5最新提示詞指南,8項調整一次看tw.news.yahoo.com · supporting### 最新台北市長選舉調查出爐了! 「這候選人」竟狂贏近3成5碾壓對手..... [Newtalk新聞] 隨著年底九合一選舉日益逼近,台北市長選情也逐漸升溫。國民黨已確定由現任市長蔣萬安爭取連任;民進黨方面,則徵召不分區立委沈伯洋出戰。根據今(3)日公布的最新民調結果,「這位候選人」竟以接近35個百分點的差距,大幅領先其他候選人。 根據《壹蘋新聞網》所進行調查,並以「蔣萬安與沈伯洋都積極爭取聲量,你支持誰當台北市長?」為題,進行網路投票,而投票將於8月6日截止,截至今日上午11時30分為止,共吸引約1.6萬人參與,其中沈伯洋以66.0%的支持度暫居第一,大幅領先蔣萬安的32.4%,雙方差距達33.6個百分點。 不過,網路投票涉及的不確定因素極多,至多只能作為觀察網友態度的參考,較難作為判斷實際選舉輿情的依據。若要關注相關選舉輿情變化,建議仍應參考各家民調機構、媒體民調中心,或委託專業民調機構所進行的民意調查。查看原文更多Newtalk新聞報導酸蔣提倒閣「藍沒什麼人要跟」 沈伯洋:要重選的又不是他北市爆兒虐掀政治攻防 沈伯洋:台北市長是蔣萬安 有無開會很難回答? Newtalk新聞 ・ 42 分鐘前 ・ 44則留言 ### 羅廷瑋大學舊片被挖!上課睡覺認了「我只要文憑」挨轟沒料 政治中心/綜合報導近日藍白在立法院審查115年度總預算案,一口氣凍刪公視10億預算、也就是一半的預算,引發影視界強烈反彈,公視製作人們也發起連署,獲得大票台人響應聲援。沒想到有網友挖出,國民黨立委羅廷瑋曾參與公視製作的《誰來晚餐》,被拍到上課時打瞌睡、成績不理想,還坦言「我只是要文憑」,律師林智群看完後忍不住狠批,「沒料的人爬到他沒辦法勝任的位置就是這樣」 民視 ・ 39 分鐘前 ・ 發表留言 ### 總裁夫人徐莉玲痛失愛子!台玻、學學文創回應了
中国模型加速AI明星“内卷”,Anthropic上新Opus 5,性能逼近Fable 5价格打对折,刷新ARC-AGI-3纪录wallstreetcn.com · supporting[]( 首页 资讯 快讯 行情 日历 APP VIP会员 大师课 生活家 登录 / 注册 758 收藏 Image 1: qrcode []( # 中国模型加速AI明星“内卷”,Anthropic上新Opus 5,性能逼近Fable 5价格打对折,刷新ARC-AGI-3纪录 Image 2: 李丹李丹 07-24 16:58 Anthropic称,Opus 5能更好地检查自身工作、发现逻辑错误并反复迭代,部分测试中达到类似表现所需的推理Token数量明显低于上一代;网络安全能力接近Mythos 5,安全分类器相比Fable 5“明显更宽松”;预计它将成为企业日常办公、软件开发、科学研究和AI智能体工作流中的默认模型。机构称,Opus 5在ARC-AGI-3基准测试中取得成绩30.2%,远超GPT-5.6 Sol所创前纪录7.8%。 AI模型的竞争,正在同时向两个方向加速:一边是价格不断下探,另一边则是模型能力继续冲击通用人工智能(AGI)的边界。 在中国新模型持续以低价和高性价比冲击市场、企业客户也开始重新审视AI支出的背景下,Anthropic率先将“降本增效”推向了高端模型市场。美东时间24日周五,Anthropic发布新一代Claude Opus模型Opus 5,称其在多个任务上的性能已经逼近公司最先进的Fable 5,但API价格只有后者的一半。 Anthropic预计,Opus 5将成为企业日常办公、软件开发、科学研究和AI智能体工作流中的默认模型,称它是Claude Max的默认模型,也是Claude Pro平台的最强模型。这意味着,Opus 5并不是一个单纯的便宜模型,而是试图将接近旗舰级的能力下沉到更广泛的企业日常任务。 [...] 另一亮点是,通过基准测试推动开源通用人工智能(AGI)研究的非营利组织ARC Prize披露,Opus 5在ARC-AGI-3基准测试中取得30.2%的超高成绩,远超GPT-5.6 Sol(Max)创造的该测试成绩前纪录7.8%。 Image 3 ARC Prize还表示,在分析过程中观察到Opus 5展现出此前未曾出现的新颖行为,使其能够解决此前未曾被攻克的复杂环境,并且表现超过Fable。 以此来看,Opus
Opus 5冲上第一,还需要Fable 5吗?|界面新闻 · JMediajiemian.com · supporting软件工程是最突出的方面。在Frontier-Bench v0.1测试中,Opus 5超过所有参测模型,成绩相比Opus 4.8提高一倍以上,单项任务成本反而更低。在CursorBench 3.2测试中,开启max effort后,两者成绩相差不到0.5%,每项任务成本约为后者一半。 类似优势也出现在需要模型连续操作的任务中。在Zapier AutomationBench测试中,按相同的单项任务成本计算,Opus 5通过率约为第二名(Fable 5)的1.5倍。在OSWorld 2.0测试中,它仅用Fable 5单项任务成本的略多于三分之一,超过了后者最好成绩。 这些项目的共同点在于,测试的不只是模型能否答对一道题,还包括它能否调用工具、跨越多个步骤、发现错误并继续推进。 ARC-AGI 3主要考察模型处理陌生规则和新问题的能力。Opus 5得到30.2%,此前榜首是GPT-5.6 Sol的7.8%。不过该成绩取自high档而非max档,max档结果尚未公布。至少在此设定下,Opus 5展现了较强的规则归纳、观察与试错能力。 不过,Opus 5并非在所有项目中都领先。在Anthropic公布的十余项对比中,有四项落后其他模型。 在Humanity’s Last Exam测试中,不用工具时,Opus 5得56.3%,略低于Fable 5的56.5%;开放工具后Opus 5升至64.7%,反超Fable 5的63.9%。这更能说明两者差别:Fable 5仍有更强的纯模型能力,Opus 5更擅长搜索、调用工具、检查结果并持续推进任务。 Anthropic披露的案例也符合这一特点。Opus 5在没有图像查看工具的情况下,自行编写计算机视觉程序,从机械图纸的原始像素中提取数据;在缺少实时行情的情况下,主动搭建测试环境验证交易所数据接口是否正确。 [...] Opus 5发布当天,英伟达、Meta、微软等25家公司和机构联合发表公开信,呼吁美国政府不要过早限制开放权重模型,OpenAI、Anthropic和Google没有出现在签署名单中。 缺席不等于明确反对开放权重,但与开放权重相比,Anthropic确实更强调闭源、分级开放和风险控制。6月12日,美国政府对Fable 5和Mythos 5实施管制,两款模型一度全面下线。限制解除后,Fable 5恢复公开服务,安
Opus 5 来了,Anthropic 的救赎时刻tmtpost.com · supporting## 三重不确定性 Opus 5 面前有三重不确定性,每一条都足以改变故事的走向。 第一,性能兑现。 目前所有关于 Opus 5 的基准数据都来自泄露和推测。在正式 benchmark 公布之前,任何“Fable-adjacent”的承诺都只是营销话术。Anthropic 在 Opus 4.7 上曾经翻过车——开发者社区普遍反映该模型在长上下文检索和工具调用上出现了明显退化。如果 Opus 5 重蹈覆辙,Anthropic 将面临连续两代旗舰的信任危机。 第二,监管风险。 如果 Opus 5 的推理能力确实接近 Fable 5,它可能面临同样的出口管制审查。美国政府已经展示了它愿意且能够关闭一款前沿模型。Anthropic 是否已经为 Opus 5 建立了足够的安全隔离?目前没有任何公开信息。 第三,定价陷阱。 Opus 5 需要在“足够便宜以吸引开发者”和“足够贵以维持毛利率”之间找到平衡。Fable 5 的 $10/$50 定价已经让不少中小团队望而却步。如果 Opus 5 定价过高,它无法阻止开发者流向 GPT-5.6 Sol 或 Gemini 3.6 Flash;如果定价过低,它会压缩 Opus 4.8 和 Sonnet 5 的生存空间,形成内部产品线的自我蚕食。 Opus 5 的发布,标志着 Anthropic 正式进入后 Fable 5 时代。它不再试图用一款模型统治所有场景,而是构建了一个清晰的梯队:Fable 5 在最顶端做标杆,Opus 5 在中高端做主力,Sonnet 5 在性价比端做普及,Haiku 4.5 在轻量端做覆盖。 这套产品矩阵的逻辑是稳健的。但稳健不等于正确。Anthropic 需要 Opus 5 成功,而且需要它现在就成功。 [...] tmt_logo 推荐 快报 广场 科股宝VIP 视频 直播 tmt_menu 媒体 企服 创投 咨询 活动 钛空时间 集团时光 公众号 清朗网络行动 写稿视频投稿App下载ENGLISH 钛媒体 链得得 钛空时间 消研所 钛媒体创投家 品牌服务 专家服务 政府服务 融资需求 申请报道 项目数据库 创投家CLUB投资机构库 机构数据库 行研报告 钛媒体钛媒体 链得得链得得 ITValueITValue
Anthropic Opus 5 Explained: The Strange Launch Nobody Is Talking Aboutyoutube.com · supportingprogram. It was live for hours, not days. And then it was gone. Pulled before most people even had a chance to screenshot it. At the time, it read like exactly the kind of thing that happens constantly in this industry. A change log entry that shows up for an afternoon, gets yanked, and disappears into the noise. Here's the claim, and I want to be precise about how confirmed it is. Multiple observers have connected honeycomb to Opus 5 based on the timing lining up and the behavior matching what later shipped. Nobody at Anthropic has confirmed that honeycomb was Opus 5 running under an internal code name. That's an inference other people are making from circumstantial timing, not a fact Anthropic has verified. I'm labeling it exactly that, a plausible thread worth watching, not a confirmed [...] it's exactly what makes the next gap so notable. The document that isn't there. Every major model release from a frontier lab is supposed to come with a model card, a document laying out what th