Z.ai上线GLM-5.3 API,面向编程与长周期智能体任务
Z.ai宣布GLM-5.3 API正式上线,重点服务于软件开发、防御性网络安全和长周期智能体工作流。官方称其价格与GLM-5.2保持一致,并可通过Z.ai官方接口及合作模型网关调用。
经过来源核查的 AI 模型、API、研究、安全和监管动态。
Z.ai宣布GLM-5.3 API正式上线,重点服务于软件开发、防御性网络安全和长周期智能体工作流。官方称其价格与GLM-5.2保持一致,并可通过Z.ai官方接口及合作模型网关调用。
一则由 Codex 工程师发布的消息称,使用 ChatGPT 账户登录 Codex 的用户现在也可以尝试 GPT-5.6 Sol 的 100 万 token 上下文配置。相关设置需要修改 Codex 配置文件或通过命令行参数临时启用。
Google发布两款Gemini 3.8模型:标准版面向长期软件工程、智能代理和复杂推理,Cyber版则专注于漏洞发现与自动修复。
OpenAI 的 GPT-5.6 构建者指南介绍了如何通过模型分层、推理设置和 Responses API 新能力,降低智能体应用的成本与延迟。官方以 BrowseComp 为例称,GPT-5.6 Luna 在极高推理档位下以 1.33 美元取得 84.04% 的成绩,接近 GPT-5.5 的 84.36%,而后者成本为 33.27 美元。
OpenAI 正在 API 中限量预览 GPT-5.6 Sol 的 Ultrafast 模式。该模式由 Cerebras 提供推理基础设施支持,官方称最高可生成每秒 750 个输出 token,并将逐步扩大客户范围。
MiniMax宣布与fal联合开展MiniMax H3技术直播,介绍如何利用多模态参考、原生音频、视频编辑和模型串联构建创作流程。相关资料显示,H3可通过fal.ai调用,也支持基于开放权重进行研究和定制。
Google 发布 Gemini 3.7 Flash,重点提升软件工程、知识密集型任务、网页开发和智能体工作流表现。官方称,新模型在多项内部基准测试中超过 Gemini 3.6 Flash,并以首发优惠价提供。
OpenAI 正在 API 中限量预览由 Cerebras 提供支持的 Ultrafast 服务层,GPT-5.6 Sol 的输出速度最高可达每秒 750 个 token。
xAI 于 2026 年 8 月 12 日发布 Grok 4.6,在 Artificial Analysis Intelligence Index 上取得 61 分,与 GPT-5.6 Sol Max 持平。官方 API 价格仍为每百万输入 token 2 美元、输出 6 美元,上下文扩至 500K,并新增 xhigh 推理档位。模型已在 xAI API、Grok Build、Cursor 等平台上线。
Databricks 宣布,Moonshot AI 的开放权重模型 Kimi K3 现已通过 Unity AI Gateway 提供使用。企业可以在现有 Lakehouse 数据环境中调用该模型,并沿用统一的访问控制、监控和治理策略。
DeepSeek 发布 V4-Flash 正式版 API,称其 Agent 能力较预览版大幅增强。官方公布的 Terminal Bench 2.1 得分为 82.7,NL2Repo 为 54.2,Toolathlon Verified 为 70.3。
DeepSeek V4 Flash 出现在部分模型目录和第三方比较页面中,主打较长上下文、较快响应与较低成本。现有证据不足以确认 ColaOS 的完整上线细节,且第三方评测并不支持其智能指数超过 GLM 5.2。
多家二手来源称,阿里通义千问团队已发布 Qwen3.8-Max,并计划在下周公开模型权重。报道将其描述为一款总参数量约 2.4 万亿、激活参数约 950 亿的多模态旗舰模型。
MiniMax H3 开放权重发布后,已获得 vLLM-Omni 的 Day 0 支持。开发者可通过兼容 OpenAI 的视频 API 调用模型,并使用异步任务或同步接口生成视频。
DeepSeek-V4-Flash 正式版 API 已上线公测,开发者无需更改调用名称即可使用。官方数据显示,新版本在多项代码、工具调用和自动化基准上超过 V4-Pro-Preview,并新增 Responses API 与 Codex 适配。
阿里旗下 Qwen 发布 Qwen3.8-Max,称其为 Qwen 系列迄今能力最强的模型。官方表示,该模型拥有 2.4 万亿参数、950 亿激活参数,并支持 100 万 Tokens 上下文。
OpenAI表示,GPT-5.6 Sol被用于优化自身运行所依赖的生产基础设施和推理栈。相关改进覆盖GPU内核、请求调度、路由、缓存及模型实现,据报道可将服务成本降低约20%,并提升代币生成效率。
DigitalOcean 已将 Moonshot AI 的 Kimi K3 接入 Inference Engine,开发者可通过托管式 Serverless Inference 使用该模型,无需自行管理推理基础设施。
DeepSeek 发布 V4-Flash-0731 API,并将其置于公开测试阶段。新版重点提升 Agent 和编程任务能力,原生支持 OpenAI Responses API,可直接接入 Codex 工作流。
一位用户称其在一天内使用 Opus 5 约28亿 Token,并认为该模型在多数能力上超过调整后的 Fable 5。不过,他同时指出,GPT-5.6 Sol 在复杂后端逻辑和长程任务上更强。现有资料确认 Opus 5 强调效率和较低 Token 消耗,但不同来源对其与 GPT-5.6 Sol、Fable 5 的基准排名存在明显分歧。