模型风险与观测

风险观测

当前风险与持续观察线索

数据截至 2026-08-10
记录状态
风险类型
下一步动作
来源
可信度
匹配:
Qwen3.8 Max Preview 兼容别名阿里巴巴 / 通义千问当前风险API / 服务API 可用性

Token Plan 禁止应用后端、自动脚本与非交互批处理

qwen3.8-max-preview ID 现已路由到正式版 qwen3.8-max,但个人 Token Plan 服务条款仍限制自动脚本、应用后端和非交互批处理。

Token Plan Individual overview官方 · 高可信发生 2026-07-19资料截至 2026-08-10
下一步动作:部署前核验

生产决策应使用正式版模型 ID,并针对实际服务渠道单独核对 API 条款;兼容 ID 不构成独立版本合同。

模型详情打开来源
Kimi K3月之暗面 / Kimi当前风险模型行为运行行为

历史 thinking 不完整或会话中途换模可能使输出不稳定

Kimi 官方要求完整回传历史 thinking 内容,并警告会话中途从其他模型切换到 K3 可能明显降低生成稳定性。

Kimi K3: Open Frontier Intelligence官方 · 高可信发生 2026-07-16资料截至 2026-07-20
下一步动作:真实任务验证

迁移前应固定模型 ID,并在真实多轮工具链中验证历史 thinking 的保存与回传。

模型详情打开来源
Kimi K3月之暗面 / Kimi当前风险模型行为运行行为

官方承认模糊任务下可能过度主动

Kimi 的发布说明称 K3 对不明确意图或简单问题有时会执行超出需要的操作。

Kimi K3: Open Frontier Intelligence官方 · 高可信发生 2026-07-16资料截至 2026-07-20
下一步动作:真实任务验证

生产代理应限制工具权限、明确停止条件,并用真实任务验证授权边界。

模型详情打开来源
Muse Spark 1.1Meta当前风险API / 服务区域可用性

Model API 仍是公开预览,当前仅限美国开发者

Meta 官方模型页将 Muse Spark 1.1 标为公开预览,并限定当前开发者区域。这意味着全球团队不能把发布公告直接等同于可采购的生产服务。

Muse Spark 1.1 model page官方 · 高可信发生 2026-07-09资料截至 2026-07-15
下一步动作:部署前核验

跨区域上线前确认账号资格、数据驻留与生产 SLA。

模型详情打开来源
Grok 4.5xAI当前风险API / 服务成本与缓存

未设置会话缓存键时,官方警告可能频繁按完整输入计费

xAI 建议在长会话中设置 prompt_cache_key 或 x-grok-conv-id;否则请求可能落到冷缓存服务器并按完整输入价格计费。

grok-4.5 | SpaceXAI Docs官方 · 高可信发生 2026-07-08资料截至 2026-07-15
下一步动作:部署前核验

成本评估应包含缓存命中率和长代理循环压缩策略。

模型详情打开来源
Claude Fable 5Anthropic当前风险数据 / 治理数据留存

安全防护要求 30 天留存,不支持零数据留存

Anthropic 的 Fable 5 防护说明明确要求 30 天安全留存,并注明该模型不支持 ZDR。该限制会直接影响受监管数据和内部敏感代码的部署边界。

Introducing Claude Fable 5 and Claude Mythos 5官方 · 高可信发生 2026-07-01资料截至 2026-07-15
下一步动作:部署前核验

在接入前由法务与安全团队确认数据分类;ZDR 是硬要求时应选择其他模型。

模型详情打开来源
MiMo-V2.5-Pro-UltraSpeed小米当前风险API / 服务访问限制

UltraSpeed 仍处于审批制封闭测试,没有固定结束或 GA 日期

小米延长了 UltraSpeed 封闭测试,但只对获批用户开放,且没有公布固定 GA 时间。

MiMo UltraSpeed beta extension notice官方 · 高可信发生 2026-06-23资料截至 2026-07-15
下一步动作:部署前核验

延迟敏感方案必须准备标准 MiMo-V2.5-Pro 回退,不应依赖测试配额。

模型详情打开来源
Claude Fable 5Anthropic当前风险模型行为安全鲁棒性

红队研究在自动化攻击中仍观察到越狱成功

一项预印本研究在其测试设置中报告 Fable 5 的最坏情形攻击成功率为 6.1%。该数字只适用于论文的方法与样本,不能外推为真实世界总体风险率。

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models研究 · 中可信发生 2026-06-20资料截至 2026-07-15
下一步动作:真实任务验证

高风险场景仍需独立红队与输出隔离。

模型详情打开来源
Qwen3.5-OCR阿里巴巴 / 通义千问当前风险API / 服务区域可用性

当前第一方 OCR 端点仅在中国区目录提供

Qwen3.5-OCR 出现在阿里云中国区目录,但全球 Model Studio 目录没有同等可用端点。跨区部署需要单独确认。

Alibaba Cloud Model Studio model pricing官方 · 高可信发生 2026-06-16资料截至 2026-07-15
下一步动作:部署前核验

国际业务不要默认可用,先确认区域、数据驻留与合同。

模型详情打开来源
Grok Imagine ImagexAI当前风险产品体验监管与隐私

加拿大隐私监管机构认定图像生成功能上线时防护不足

加拿大隐私专员办公室认定 X/xAI 推出相关图像生成能力时未设置充分隐私防护,后续才增加措施。该结论针对已部署产品,不等同于对 API 基础模型能力的判定。

Canadian privacy regulator finding on X and xAI官方 · 高可信发生 2026-06-11资料截至 2026-07-15
下一步动作:部署前核验

涉及真实人物的生成工作流需要同意、身份与内容审核控制。

模型详情打开来源
Kimi K2.7 Code月之暗面 / Kimi当前风险API / 服务运行行为

编码端点始终启用思考,延迟与输出 token 不可按普通聊天模型估算

Moonshot 快速入门将 K2.7 Code 描述为始终思考的工具调用模型。长代理循环可能因此增加端到端延迟和输出成本。

Kimi K2.7 Code quickstart官方 · 高可信发生 2026-06-11资料截至 2026-07-15
下一步动作:真实任务验证

用真实仓库任务测量完成时间与总 token,而不是只看单次响应速度。

模型详情打开来源
Claude Fable 5Anthropic当前风险API / 服务防护与拒绝

安全分类器可能以 HTTP 200 返回拒绝,需要显式 fallback

官方集成文档要求应用识别 stop_reason=refusal,并通过服务端、SDK 或手动方式回退到其他 Claude 模型。

Introducing Claude Fable 5 and Claude Mythos 5官方 · 高可信发生 2026-06-09资料截至 2026-07-15
下一步动作:真实任务验证

不处理拒绝分支会把正常响应误判为任务完成。

模型详情打开来源
MiniMax-M3MiniMax当前风险API / 服务上下文容量

512K 至 1M 上下文的 API 单价是 512K 以内的两倍

MiniMax 企业 API 价格页显示,512K 至 1M 输入范围的输入、缓存和输出单价均为 512K 以内费率的两倍。页面当前不再支持“限量供应”的说法。

MiniMax enterprise API token pricing官方 · 高可信发生 2026-06-01资料截至 2026-07-15
下一步动作:真实任务验证

百万上下文任务应按对应阶梯独立预算,并在 512K 边界做回归测试。

模型详情打开来源
LongCat-2.0美团当前风险API / 服务迁移风险

六个上一代 LongCat Flash API 条目已于 5 月 29 日停服

美团变更日志列出 Chat、Thinking 与 Omni 系列的六个旧模型 API 于 5 月 29 日停止服务,并记录 LongCat-2.0 于 6 月 30 日上线。开放权重仍可下载不代表旧 API 连续性。

LongCat platform change log官方 · 高可信发生 2026-05-29资料截至 2026-07-15
下一步动作:部署前核验

新接入固定 LongCat-2.0,并为模型 ID、提示与工具协议变更设置迁移测试。

模型详情打开来源
Grok 4.20 ReasoningxAI当前风险模型行为安全鲁棒性

官方模型卡披露代理伤害、提示注入与误用评测失效率

xAI 的 Grok 4.20 模型卡分别报告 30% AgentHarm 违规率、33% AgentDojo 提示注入成功率,以及在系统提示覆盖设置下 32% 的误用违规率。这些数字只适用于模型卡所述测试。

Grok 4.20 model card官方 · 高可信发生 2026-04-07资料截至 2026-07-15
下一步动作:真实任务验证

不可把该模型直接用于自主高风险决策;代理工具权限需要最小化并隔离。

模型详情打开来源
Grok 4.5xAI持续观察产品体验使用额度

新帖报告 SuperGrok 4.5 在约两小时编码会话后触及周额度

7 月 14 日一则 r/grok 讨论中,一名用户称其通过 Grok CLI 进行普通 JavaScript 编码会话约两小时后触及 SuperGrok 4.5 周额度;同一回复肯定了速度,但认为完成任务需要更多提示,并质疑套餐额度透明度。该单一公开线程只反映消费者订阅/Grok CLI 体验,不等同于 xAI API 限额,也不是总体样本。

Grok weekly limits社区 · 低可信线索发生 2026-07-14资料截至 2026-08-04
下一步动作:持续观察

用真实工作流验证订阅额度与提示轮次;生产容量仍应按固定 API 模型和正式限额规划。

模型详情打开来源
Grok 4.5xAI持续观察产品体验质量回归

近期用户帖报告准确性与写作体验下降

一则近期 r/grok 帖文称当前 Grok 更常给出错误信息,讨论区也出现写作质量下降的反馈。单帖及回复只能作为待验证线索。

So long Grok. It was fun, then it was awful.社区 · 低可信线索发生 2026-07-12资料截至 2026-08-04
下一步动作:持续观察

在真实任务集上做回归测试,不要根据单一社区帖子直接淘汰模型。

模型详情打开来源
Claude Fable 5Anthropic持续观察产品体验防护与拒绝

安全研究者报告正常代码审查也可能触发防护

TechCrunch 汇总多位安全研究者反馈,称部分正常代码审查和安全资料阅读请求会触发 Fable 的防护或回退。

Cybersecurity researchers aren't happy about the guardrails on Anthropic's Fable媒体 · 中可信发生 2026-06-10资料截至 2026-08-04
下一步动作:真实任务验证

这是特定专业用户反馈,不代表所有任务;安全研发场景应先做真实工作流试跑。

模型详情打开来源
记录状态当前风险在卡片所示日期仍影响选型、采购或部署。持续观察公开信息仍在变化或不完整,暂不作为确定结论。历史记录曾经有效、已经过期或不再支持当前风险判断,不进入默认当前列表。
下一步动作部署前核验接入或采购前核对当前接口、型号与使用条件。真实任务验证用自己的工作负载验证能力与稳定性。持续观察证据仍在变化或尚不完整,继续跟踪。
历史记录7
Qwen3.8 Max Preview 兼容别名阿里巴巴 / 通义千问历史API / 服务版本透明度

预览模型 ID 已并入正式版兼容入口

QwenCloud 已确认 qwen3.8-max-preview 仍可调用,但会自动路由到正式版 qwen3.8-max,扣费与用量统计也按正式版计算。

Token Plan Individual overview官方 · 高可信发生 2026-07-19资料截至 2026-08-10结束 2026-08-10
下一步动作:历史记录

历史预览评测仍需保留日期;当前选型与成本判断应使用 qwen3.8-max,不再把 preview ID 当作独立模型。

模型详情打开来源
Kimi K3月之暗面 / Kimi历史API / 服务访问限制

完整权重已于 7 月 27 日发布,先前可用性缺口已关闭

Moonshot 已公开 Kimi K3 完整权重、模型卡与 Kimi K3 License;先前“权重尚未发布”的观测不再是当前风险。

MoonshotAI/Kimi-K3 official repository官方 · 高可信发生 2026-07-16资料截至 2026-08-04结束 2026-07-27
下一步动作:历史记录

本地部署仍需核对 Kimi K3 License;开放权重不包含 Kimi.com 的托管 Agent 编排、工具路由与服务栈。

模型详情打开来源
DeepSeek V4 FlashDeepSeek历史API / 服务别名与生命周期

7 月 24 日迁移期限已经过去,原前瞻提醒转入历史

原记录描述的是截止日前的迁移风险,不能在截止日后继续显示为当前负面事实。当前别名解析目标和可用模型 ID 需要以实时 API 模型清单重新核对。

DeepSeek current API model documentation官方 · 高可信发生 2026-07-13资料截至 2026-08-04结束 2026-07-24
下一步动作:历史记录

生产调用仍应固定明确模型 ID、记录返回版本,并在上线前重新拉取当前模型清单。

模型详情打开来源
Grok Imagine Video 1.5xAI历史产品体验使用额度

7 月 10 日单帖曾报告 15 秒生成选项不可用

来源能够支持的范围只是一名用户当时无法选择 15 秒生成;它不能证明旧资产被删除。7 月 15 日确认后纠正原范围并转入历史。

xAI reset Grok limits and removed 15s from Imagine社区 · 低可信线索发生 2026-07-10资料截至 2026-07-15结束 2026-07-15
下一步动作:历史记录

产品配额与选项可能变化;重要资产仍应在自有存储中留存。

模型详情打开来源
Seedream 5.0 Pro字节跳动 / 豆包历史产品体验API 可用性

7 月 15 日已确认可调用 API,先前证据缺口不再成立

官方 Seedream 5.0 Pro 页面现已提供 Get API 入口,并链接到 BytePlus Ark 对应模型条目。先前“API 可用性未确认”的负面观测已被一方证据纠正,转入历史。

Seedream 5.0 Pro official model page官方 · 高可信发生 2026-07-08资料截至 2026-07-15结束 2026-07-15
下一步动作:历史记录

实际采购仍需按账号区域核对价格、配额与 SLA。

模型详情打开来源
Grok 4.5xAI历史产品体验版本透明度

7 月 2 日单帖曾质疑产品界面的模型版本透明度

该社区帖称模型可能回退或难以确认实际版本,但模型自报与单一用户推测不能证明当前路由状态。7 月 15 日确认时没有找到足够证据继续作为当前风险,转入历史。

Grok model version roll-back to 4.20?社区 · 低可信线索发生 2026-07-02资料截至 2026-07-15结束 2026-07-15
下一步动作:历史记录

如需严肃评测,仍应固定 API 模型 ID 并记录响应元数据。

模型详情打开来源
Claude Fable 5Anthropic历史API / 服务可用性

曾因出口管制暂停,7 月 1 日恢复全球访问

6 月 12 日暂停访问,7 月 1 日恢复全球可用。中断已经结束,保留为供应连续性历史记录。

Redeploying Claude Fable 5官方 · 高可信发生 2026-07-01资料截至 2026-07-15结束 2026-07-01
下一步动作:历史记录

当前无需按中断处置;保留供应商切换与模型降级预案。

模型详情打开来源