资讯
模型发布、价格调整、下线和新能力,来自各厂商的官方页面与公告。摘要由我们撰写,每条都附来源。
- 2026年10月3日 xAI 停用 grok-voice-transcribe-1.0 grok-voice-transcribe-1.0 于 2026 年 10 月 2 日停止服务。发往该模型标识的请求会转至 grok-voice-transcribe-2.0,价格不变。
- 2026年10月2日 Google 下线 Gemini 2.5 Flash Image Gemini 2.5 Flash Image 已下线。
- 2026年10月1日 OpenAI 弃用 gpt-4o-mini-tts (2025-12-15)、gpt-4o-mini-tts (2025-03-20) gpt-4o-mini-tts (2025-12-15)、gpt-4o-mini-tts (2025-03-20) 已被弃用,将于 2027-01-06 下线。
- 2026年10月1日 OpenAI 弃用 tts-1、tts-1-hd、GPT-5.4 nano、GPT-5.3 Codex、GPT-5.1 tts-1、tts-1-hd、GPT-5.4 nano、GPT-5.3 Codex、GPT-5.1 已被弃用,将于 2027-01-06 下线。
- 2026年10月1日 OpenAI 下线 gpt-5.4-cyber gpt-5.4-cyber 已下线。
- 2026年9月30日 Alibaba Qwen 下线 deepseek-r1-distill-llama-8b deepseek-r1-distill-llama-8b 已下线。
- 2026年9月30日 Anthropic 计划停止 Claude Sonnet 4.5 Anthropic 计划于 2026 年 11 月 30 日在 Claude API 中停止提供 Claude Sonnet 4.5(claude-sonnet-4-5-20250929)。Anthropic 建议迁移至 Claude Sonnet 5.5。
- 2026年9月30日 Black Forest Labs 发布 FLUX 3 Image FLUX 3 Image 已通过一个端点开放,可用于图像生成和编辑,最多支持十张参考图像,输出最高可达 4K。每张图像的价格从 768sq 分辨率的 0.041 美元到 4K 的 0.607 美元不等。
- 2026年9月30日 Google 发布 Gemini 4 Argon Google 发布 Gemini 4 Argon,输出 token 上限为 100 万。目前该模型正向可信的网络防御人员开放,开发者暂时无法使用;Google 表示之后将向开发者开放。
- 2026年9月30日 Google 下线 gemini-omni-flash-preview gemini-omni-flash-preview 已下线。
- 2026年9月30日 Runway 将 Eleven v4 引入 Runway Dev Eleven v4 已在 Runway Dev 上提供语音生成,脚本最长可达 2,500 个字符。每 1,000 个字符在 2026 年 10 月 12 日 PT 前收费 2.2 credits,此后收费 5 credits,最低收费 1 credit。
- 2026年9月29日 Inception 正式推出 Mercury Voice Inception 已面向企业客户正式推出 Mercury Voice,支持 128K token 上下文、最多 50K 输出 token 和三档推理设置。标准价为每百万输入 token 0.40 美元、每百万输出 token 1.50 美元,发布期间五折(0.20 美元与 0.75 美元)。
- 2026年9月29日 MiniMax 发布 minimax-m3.1-flash-preview 上下文 1M tokens。
- 2026年9月29日 Mistral AI 停用 Leanstral 1.5 和 GLM 5.2 Leanstral 1.5 将于 2026 年 9 月 30 日停用;Z.ai GLM 5.2 将于 2026 年 10 月 31 日停用。Mistral AI 建议以同价的 Z.ai GLM 5.3 替代后者。
- 2026年9月29日 OpenAI 为 Agents API 添加计算机使用能力 OpenAI 为 Agents API 添加了计算机使用能力,允许智能体在 OpenAI 托管的浏览器中完成任务。网站访问审批和登录由应用程序处理。
- 2026年9月29日 OpenAI 为 GPT-6 Astra 添加 Ultrafast 模式 OpenAI 在 Responses API 中为 GPT-6 Astra 添加了 Ultrafast 模式。API 客户可使用 ultrafast 服务层缩短生成输出令牌之间的时间,但受速率限制约束。
- 2026年9月29日 OpenAI 发布 GPT-6.1 Sol OpenAI 发布了 GPT-6.1 Sol(gpt-6.1-sol),用于复杂编程和专业工作。输入不超过 272K token 的提示按标准价计费:每百万输入 token 2 美元、缓存输入 0.10 美元、输出 10 美元。
- 2026年9月28日 Anthropic 发布 Claude Sonnet 5.5 Anthropic 推出 Claude Sonnet 5.5(claude-sonnet-5-5),已在 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry 提供。上下文窗口、输出上限与价格见其模型页面。
- 2026年9月28日 ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo Eleven v4 和 Eleven v4 Turbo 现已推出。Eleven v4 支持 90 多种语言的语音克隆;Turbo 面向实时应用,推理延迟中位数约为 100 毫秒。
- 2026年9月25日 Meituan 发布 LongCat-2.5-Preview 上下文 1M tokens。LongCat API:输入 $0.30、输出 $1.20 每百万 tokens。
- 2026年9月25日 Perplexity 下调 fast preset 搜索价格 Agent API 的 fast preset 现改用 Fast Search。web_search 从每 1,000 次调用 $2.50 降至 $1.00,搜索约快 800 毫秒。
- 2026年9月24日 Perplexity 新增 Fast Search 选项 Search API 与 Agent API 的 web_search 可将 search_type 设为 fast,走更低延迟路径,每 1,000 次请求或调用 $1.00。Agent API 的模型 token 另计;search_type web 为标准网页搜索。
- 2026年9月23日 Black Forest Labs 发布 FLUX 3 Action Black Forest Labs 发布开源权重的 7B 世界-动作模型 FLUX 3 Action,基于其 FLUX 3 骨干,并提供权重下载。在 RoboLab-120 上,参数不到此前最佳开源模型的一半,速度最高达 3.95 倍。
- 2026年9月23日 Meta 推出 Muse Realtime Avatar 2026 年 9 月 23 日,Meta 推出 Muse Realtime Avatar。它依据 Muse Realtime Voice 的语音 token 与参考素材,实时生成同步的面部、手部与全身视频。
- 2026年9月22日 Anthropic 支持在对话中途定义工具 在 Claude API 上,借助 inline-tools-2026-09-15 beta 头,可在对话中途的系统消息中放入完整工具定义;配合 MCP connector beta 头还可使用 MCP 工具集,而无需修改 tools 列表。
- 2026年9月22日 Anthropic 为 Claude Opus 5.5 推出快速模式预览 Claude API 上的 Claude Opus 5.5 现提供研究预览版快速模式。
- 2026年9月22日 Anthropic 发布 Claude Opus 5.5 Anthropic 发布 Claude Opus 5.5(claude-opus-5-5):100 万 token 上下文、最大输出 12.8 万 token,自适应思考始终开启,价格为每百万 token $4/$20(Claude Opus 5 为 $5/$25)。已在 Claude API、Amazon Bedrock、AWS、Google Cloud 和 Microsoft Foundry 提供。
- 2026年9月22日 Google 发布 Gemini 3.8 Flash TTS 模型 Gemini 3.8 Flash TTS(gemini-3.8-flash-tts)与 Gemini 3.8 Flash-Lite TTS(gemini-3.8-flash-lite-tts)正式可用,并提供 Gemini API Voices 端点。Flash-Lite TTS 旨在取代 gemini-3.1-flash-tts-preview。
- 2026年9月22日 Xiaomi 发布 MiMo-V2.6-Flash 上下文 1M tokens。Xiaomi MiMo API:输入 $0.14、输出 $0.28 每百万 tokens。
- 2026年9月22日 Xiaomi 发布 MiMo-V2.6-Pro 上下文 1M tokens。Xiaomi MiMo API:输入 $0.435、输出 $0.87 每百万 tokens。
- 2026年9月22日 Xiaomi 发布 MiMo-V2.6-Pro-UltraSpeed 上下文 1M tokens。Xiaomi MiMo API:输入 $4.35、输出 $8.70 每百万 tokens。
- 2026年9月22日 OpenAI 改进 GPT-6 的提示缓存 OpenAI 表示,GPT-6 系列默认的提示缓存命中率更高,30 分钟内重复使用的共享前缀可享缓存折扣。新增工具包括缓存用量面板、解释缓存未命中原因的诊断工具、显式缓存断点,以及在对话中途调整推理强度而不破坏缓存。
- 2026年9月22日 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna OpenAI 发布 GPT-6 Sol(gpt-6-sol)与 GPT-6 Luna(gpt-6-luna),可通过 Responses 与 Chat Completions 接收文本和图像并生成文本。输入不超过 272K token 的提示按标准价计费,每百万 token:Sol 输入 $2、缓存输入 $0.20、输出 $10;Luna 为 $0.10、$0.01 与 $0.50。
- 2026年9月21日 xAI 发布 Grok 4.7 上下文 500K tokens。xAI API:输入 $2.00、输出 $6.00 每百万 tokens。
- 2026年9月21日 Alibaba Qwen 发布 qwen3.8-omni-flash-realtime 上下文 197K tokens。
- 2026年9月20日 Qwen 开源 Qwen-Image-2.1 Qwen 于 2026 年 9 月 20 日开源 Qwen-Image-2.1。这款拥有 70 亿参数的图像模型融合了文生图和图像编辑,并原生支持透明图像。
- 2026年9月20日 Alibaba Qwen 发布 qwen-audio-3.1-realtime-plus 上下文 262K tokens。
- 2026年9月18日 Qwen 发布 Qwen3.8-LiveTranslate Qwen 于 2026 年 9 月 18 日发布 Qwen3.8-LiveTranslate,称其采用 Interleave 架构进行实时同声传译。其平均滞后指标从 2.8 秒降至 2.3 秒。
- 2026年9月18日 Google 限制 Gemini 2.5 模型访问 Google 将 Gemini 2.5 的 API 访问限制为曾实际使用过这些模型的用户。模型未弃用,在另行通知前仍可通过 API 提供。新项目应使用 3.5 Flash-Lite 或 3.8 Flash。
- 2026年9月17日 Google 发布 Antigravity Agent 09-2026 Google 发布 antigravity-preview-09-2026,取代 antigravity-preview-05-2026。本地工具参数与文件编辑有变;仅读取远程输出时只需更新 agent 字符串。5 月预览版将于 2026 年 10 月 5 日关闭。
- 2026年9月17日 Alibaba Qwen 发布 qwen3.8-omni-flash 上下文 1M tokens。Alibaba Cloud Model Studio:输入 $0.15、输出 $0.47 每百万 tokens。
- 2026年9月17日 Runway 在 Dev 上线 Enhance Frame Rate Runway Dev 现可将视频转换到 24、25、30、48、50、60、120、23.98、29.97 或 59.94 fps。输入最长 300 秒,按每 2 秒 1 credit 计费,通过视频放大端点并指定模型 enhance_frame_rate 使用。
- 2026年9月16日 Alibaba Qwen 发布 qwen-mt-uni qwen-mt-uni 已上线。
- 2026年9月15日 Google 发布 Gemini 3.8 Live 模型 Gemini 3.8 Live(gemini-3.8-live)与 Gemini 3.8 Live Extended Thinking(gemini-3.8-live-extended-thinking)正式可用,为 Live API 上的音频到音频模型。
- 2026年9月15日 TypeSafe 发布 Jev(预览版) 上下文 64K tokens。TypeSafe API:输入 $0.042、输出 $0.00 每百万 tokens。
- 2026年9月15日 Kling AI 发布 Virtual Try-On 3.0 Virtual Try-On 3.0 提升人脸一致性与画面质量。支持平铺、人台和上身服装图,并可锁定姿势、保留人脸以及选择是否保留原背景。V1 与 V1.5 参数已适配到 3.0 流程。
- 2026年9月14日 Anthropic 为 Messages API 增加按需对话压缩 Anthropic 的 Messages API 现以 beta(compact-2026-09-04)支持按需压缩对话。发送 compaction 参数后返回已签名摘要块,后续请求可将其置于前面以替代原消息,并保留最近几轮原文。
- 2026年9月13日 Perplexity 支持自定义 MCP connector Project 只需注册一次远程 MCP 服务器,凭证由 Perplexity 保存。Agent API 请求使用 connector ID,type 为 connector。支持 API key 或无认证,以及 Streamable HTTP 或 SSE。
- 2026年9月11日 ElevenLabs 正式推出 Scribe v2 Medical Scribe v2 Medical 现已正式开放,用于批量医疗和临床语音识别。其收费与 Scribe v2 相同。
- 2026年9月10日 Black Forest Labs 为 FLUX 3 Video 增加 2K 与 4K FLUX 3 Video 接口现可一次返回 qhd(2560×1440)与 uhd(3840×2176),draft_enhance 也可将草稿直接提升到这两种分辨率(草稿本身仍为 hd)。文生与图生每秒加收 $0.40 与 $0.80,视频续写为 $0.65 与 $0.95。
- 2026年9月10日 DeepSeek 发布 DeepSeek-V4.1-Flash DeepSeek 发布新架构系列中最小的 DeepSeek-V4.1-Flash,具备原生多模态视觉理解,API 模型名为 deepseek-flash。已退役的 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 暂时路由到该模型。V4 Pro 在 2026 年 9 月 14 日后继续提供且计费不变,API 价格随本次发布下调。
- 2026年9月10日 OpenAI 正式推出 GPT-Live 1 GPT-Live 1 已在 API 中正式可用,支持全双工语音会话,后端模型或智能体可同时处理推理与工具。语音按每分钟 $0.05、按秒计费;模型与工具用量另行收费。
- 2026年9月10日 OpenAI 公开发布 Agents API 测试版 OpenAI 以公开测试版发布 Agents API,由托管的 Codex 运行环境负责会话编排、上下文压缩与恢复。会话可流式返回进度,接入自有工具与 MCP 服务器,并在 OpenAI 或客户沙箱中运行。
- 2026年9月8日 Inception 发布 Mercury 2.5 Inception 发布 Mercury 2.5,质量高于 Mercury 2,上下文为 260K tokens,速度为每秒 1,107 tokens。标价为每百万输入 tokens $0.20、每百万输出 tokens $0.75,上线时优惠 80%。
- 2026年9月8日 OpenAI 正式提供 GPT-Rosalind OpenAI 通过可信访问计划,向获批的内部生命科学研究开放 GPT-Rosalind(gpt-rosalind-research)。价格为每 100 万 input、缓存 input、output tokens 分别为 5、0.50、25 美元。计费自 2026 年 10 月 5 日开始。
- 2026年9月8日 OpenAI 发布 GPT Image 2.5 Sunburst 与 Flare OpenAI 发布 GPT Image 2.5 Sunburst 与 GPT Image 2.5 Flare,可通过 Image API 及 Responses 的图像生成工具进行生成与编辑。两者支持新的 xhigh 与 max 质量设置,并采用 GPT Image 2 的 token 费率。
- 2026年9月7日 Kling AI 推出 Video Commerce API Kling AI 通过 API 与 Agent 推出 Video Commerce。角色图加口播脚本可生成口播视频;加入商品图则生成推广镜头。可设置音频速度、宽高比、分辨率、音色、语速和背景音乐。
- 2026年9月4日 Ant Group 发布 Ling-3.0-flash-VL 2026年9月4日,Ant Group 推出多模态模型 Ling-3.0-flash-VL。用户可在聊天界面体验,并通过兼容 OpenAI 与 Anthropic 协议的 API 调用。
- 2026年9月3日 Google 发布 Lyria 3.5 音乐模型 Lyria 3.5(lyria-3.5)正式可用,用于生成完整歌曲。它接受文本和图像输入,输出 44.1 kHz 立体声音频,并可控制时长与结构。
- 2026年9月3日 OpenAI 为 GPT-6 Astra 增加长时间任务控制 Responses API 为 GPT-6 Astra 增加异步工具调用、通过 WebSocket 的回合中引导,以及对话中途调整推理力度,同时保留已缓存的提示前缀。
- 2026年9月3日 OpenAI 发布 GPT-6 Astra OpenAI 在 Responses 与 Chat Completions API 发布 GPT-6 Astra,用于推理、编程、计算机操作、研究与文档。它不支持 none 推理力度、自定义 temperature、top_p 和 logprobs。工具调用需使用 Responses API。
- 2026年9月2日 Google 发布 Gemini 3.8 Flash gemini-3.8-flash 正式可用。Google 称其为最智能的 Flash 模型,面向长周期软件工程、智能体与企业工作流。
- 2026年9月2日 Meta 发布 Muse Spark 1.3 2026 年 9 月 2 日,Meta 发布 Muse Spark 1.3,含 max reasoning 选项,已在 Muse Code 与 Meta Model API 提供。它面向更强的 agent 与编程任务,并更可靠地遵循长指令。
- 2026年9月2日 Alibaba Qwen 发布 Qwen3.8 Max (2026-09-02) 上下文 1M tokens。Alibaba Cloud Model Studio:输入 ¥12.00、输出 ¥36.00 每百万 tokens。
- 2026年9月1日 Anthropic 公布 Claude Fable 5.1 缓存读取价格 Claude Fable 5.1 与 Claude Mythos 5.1 的缓存读取为每百万 token 0.25 美元,即基础输入价的 0.025 倍,其他模型为 0.1 倍。缓存写入价格不变。
- 2026年9月1日 Anthropic 发布 Claude Fable 5.1 Anthropic 推出 Claude Fable 5.1(claude-fable-5-1),作为 Claude Fable 5 的后继。默认上下文 100 万 token,最大输出 12.8 万,价格为每百万 token 10/50 美元,缓存读取 0.25 美元,已在 Claude API、Bedrock、AWS、Google Cloud 和 Microsoft Foundry 提供。
- 2026年9月1日 Anthropic 发布 Claude Mythos 5.1 上下文 1M tokens。
- 2026年9月1日 Google 为 Gemini 增加智能体式视频理解 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 在 Interactions 和 GenerateContent API 上提供智能体式视频理解。Google 称处理长视频时,token 用量可比静态处理最多减少 88%。
- 2026年9月1日 Meta 发布 Muse Voice Transcribe 2026 年 9 月 1 日,Meta 发布实时音频模型 Muse Voice Transcribe,支持流式语音识别、20 位以上说话人分离、端点检测,以及多语言语码转换。
- 2026年9月1日 Alibaba Qwen 发布 qwen3.7-text-embedding-flash qwen3.7-text-embedding-flash 已上线。
- 2026年9月1日 Alibaba Qwen 发布 qwen3.7-text-rerank qwen3.7-text-rerank 已上线。
- 2026年9月1日 MongoDB 发布 rerank-3-lite rerank-3-lite 已上线。
- 2026年9月1日 MongoDB 发布 rerank-3 rerank-3 已上线。
- 2026年8月31日 Mistral AI 正式提供 OCR 4.1 2026年8月31日,Mistral AI 将 OCR 4.1(mistral-ocr-4-1)转为正式可用。
- 2026年8月28日 Tencent 发布 Hy4 Preview 上下文 1.02M tokens。Tencent Cloud TokenHub:输入 ¥6.00、输出 ¥18.00 每百万 tokens。
- 2026年8月28日 Alibaba Qwen 发布 qwen-mt-image-2.0 qwen-mt-image-2.0 已上线。
- 2026年8月27日 Google 发布 Gemini Omni Flash Gemini Omni Flash 已上线。
- 2026年8月26日 Google 发布 Gemini 3.5 Transcribe Live Gemini 3.5 Transcribe Live 已上线。
- 2026年8月26日 Google 发布 Gemini 3.5 Transcribe Gemini 3.5 Transcribe 已上线。
- 2026年8月26日 Zhipu AI 发布 GLM-5.3-Flash 上下文 1M tokens。Z.ai API:输入 $0.15、输出 $0.50 每百万 tokens。
- 2026年8月26日 OpenAI 弃用 whisper-1、gpt-4o-transcribe、gpt-4o-mini-transcribe、gpt-4o-transcribe-diarize whisper-1、gpt-4o-transcribe、gpt-4o-mini-transcribe、gpt-4o-transcribe-diarize 已被弃用,将于 2027-02-26 下线。
- 2026年8月26日 Alibaba Qwen 发布 Qwen3.8 Flash 上下文 1M tokens。Alibaba Cloud Model Studio:输入 $0.15、输出 $0.47 每百万 tokens。
- 2026年8月20日 Alibaba Qwen 发布 Wan3.0 Video Prime Wan3.0 Video Prime 已上线。
- 2026年8月18日 Zhipu AI 发布 GLM-5.3 上下文 1M tokens。Z.ai API:输入 $1.40、输出 $4.40 每百万 tokens。
- 2026年8月17日 Alibaba Qwen 发布 qwen3.8-27b 上下文 1M tokens。Alibaba Cloud Model Studio:输入 $0.50、输出 $3.00 每百万 tokens。
- 2026年8月13日 Google 发布 Gemini 3.7 Flash 上下文 1.05M tokens。Gemini API:输入 $0.75、输出 $3.75 每百万 tokens。
- 2026年8月12日 xAI 发布 Grok 4.6 上下文 500K tokens。xAI API:输入 $2.00、输出 $6.00 每百万 tokens。
根据数据集中已核实的变化或厂商的官方公告,用我们自己的话写成,附来源链接并自动发布。