Gemini 3.1 Pro Preview调用ID:google/gemini-3.1-pro-preview文本编程智能代理与数据多模态理解文档与办公数学与科学+5文本编程智能代理与数据多模态理解文档与办公数学与科学Gemini 3.1 Pro Preview 专为高级开发和智能体系统而设计,在提升令牌效率的同时,增强了长期稳定性、工具编排能力。它引入了一种新的中间思维模式,以更好地平衡成本、速度和性能。该模型在智能体编码、结构化规划、多模态分析和工作流自动化方面表现出色,因此非常适合自主智能体、金融建模、电子表格自动化和高上下文企业任务。价格多项属性定价多项属性定价输入≤200k¥14/M token200k~不限¥28/M token输出≤200k¥84/M token200k~不限¥126/M token缓存读≤200k¥1.4/M token200k~不限¥2.8/M token
Qwen3.5-Plus调用ID:ali/qwen3.5-plus文本多模态理解编程文档与办公内容创作对话与客服+5文本多模态理解编程文档与办公内容创作对话与客服Qwen3.5原生视觉语言系列Plus模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在多项任务评测中,3.5系列均展现出与当前顶尖前沿模型相媲美的卓越性能,模型效果在纯文本与多模态方面相较3系列均实现飞跃式进步。输入¥2/M输出¥3/M上下文128K
GPT-5.4调用ID:openai/gpt-5.4文本编程智能代理与数据文档与办公多模态理解+4文本编程智能代理与数据文档与办公多模态理解GPT-5.4 是 OpenAI 最新的前沿模型,将 Codex 和 GPT 系列整合为一个系统。它配备了 1M+令牌上下文窗口(922K 输入,128K 输出),支持文本和图像输入,支持同一工作流程中的高上下文推理、编码和多模态分析。该模型在编码、文档理解、工具使用和指令执行方面提供了更好的性能。它被设计为通用任务和软件工程的强默认选项,能够生成生产质量的代码,综合多个来源的信息,并以更少的迭代和更高的令牌效率执行复杂的多步工作流程。价格多项属性定价多项属性定价输入≤272k¥17.5/M token272k~不限¥35/M token输出≤272k¥105/M token272k~不限¥157.5/M token缓存读≤272k¥1.75/M token272k~不限¥3.5/M token
GPT-5.3 Chat调用ID:openai/gpt-5.3-chat文本对话与客服+1文本对话与客服GPT-5.3 Chat 是对 ChatGPT 最常用模型的升级,使日常对话更加流畅、实用且直接实用。它能提供更准确的答案,更好地提供上下文,显著减少不必要的拒绝、附加条件和过于谨慎的措辞,避免打断对话流畅。输入¥12.25/M输出¥98/M上下文400K
GPT 5.3 Codex调用ID:openai/gpt-5.3-codex文本编程智能代理与数据多模态理解数学与科学+4文本编程智能代理与数据多模态理解数学与科学GPT-5.3-Codex 将先进的编码能力、更广泛的推理和专业问题解决整合在一个专为真实工程工作打造的单一模型中。它将 GPT-5.2-Codex 的前沿编码性能与 GPT5.2 的推理和专业知识能力整合到一个系统中。这使得体验从优化孤立输出转向支持更长时间的开发工作;当仓库庞大、变更跨越多个步骤,且需求不总是在一开始就完全明确时。输入¥12.25/M输出¥98/M上下文400K
Gemini 3.1 Flash Lite Preview调用ID:google/gemini-3.1-flash-lite-preview文本对话与客服内容创作文档与办公编程数学与科学+5文本对话与客服内容创作文档与办公编程数学与科学Gemini 3.1 Flash-Lite 是谷歌最具成本效益的 Gemini 型号,针对低延迟、高成本的大型语言模型流量进行了优化。它相比 Gemini 2.0/2.5 Flash-Lite 型号实现了显著的质量提升,在关键能力领域的性能与 Gemini 2.5 闪存相当。价格多项属性定价多项属性定价缓存写(5m)公开价格¥0.581/M token
Gemini 3.1 Flash Image调用ID:google/gemini-3.1-flash-image图像生成图像与设计多模态理解+2图像生成图像与设计多模态理解谷歌最强图像模型,nano banana 2 。Gemini 3.1 Flash Image 将最强大的图像生成功能推向主流市场。它提升了图像质量、视觉理解能力,更好地渲染了多种语言的长文本段落,并提高了图像的真实性。该模型还能够生成分辨率从 512 (0.25MP) 到 4K (16MP) 的图像。价格多项属性定价多项属性定价图片·输入公开价格¥3.5/M token图片·输出公开价格¥420/M token
Qwen3.5-397B-A17B调用ID:ali/qwen3.5-397b-a17b文本编程多模态理解智能代理与数据数学与科学+4文本编程多模态理解智能代理与数据数学与科学Qwen3.5系列397B-A17B原生视觉语言模型,基于混合架构设计,融合了线性注意力机制与稀疏混合专家模型,实现了更高的推理效率。在语言理解、逻辑推理、代码生成、智能体任务、图像理解、视频理解、图形用户界面(GUI)等多种任务中,均展现出与当前顶尖前沿模型相媲美的卓越性能。具备强大的代码生成与智能体能力,对于各类智能体场景具有良好的泛化性。价格多项属性定价多项属性定价输入≤128k¥1.2/M token128k~256k¥3/M token输出≤128k¥7.2/M token128k~256k¥18/M token
Doubao-Seedream-5.0-lite调用ID:bytedance/doubao-seedream-5-0-lite图像生成图像与设计+1图像生成图像与设计Doubao-Seedream-5.0-lite是字节跳动发布的最新图像创作模型。该模型首次搭载联网检索功能,能融合实时网络信息,提升生图时效性。同时,模型的聪明度进一步升级,能够精准解析复杂指令和视觉内容。此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。价格多项属性定价多项属性定价每张图片公开价格¥0.22/每张图片
Flux-1.1-pro调用ID:black-forest-labs/flux-1.1-pro图像生成图像与设计+1图像生成图像与设计更快、更好的 FLUX Pro。文本转图像模型,具有出色的图像质量、快速的一致性和输出多样性。价格多项属性定价多项属性定价每张图片公开价格¥0.28/每张图片
Flux-kontext-max调用ID:black-forest-labs/flux-kontext-max图像生成图像与设计+1图像生成图像与设计一种基于文本的高级图像编辑模型,可提供最佳性能和改进的排版生成,通过自然语言提示转换图像价格多项属性定价多项属性定价每张图片公开价格¥0.56/每张图片
Doubao-Seed-2.0-pro调用ID:bytedance/doubao-seed-2-0-pro文本多模态理解智能代理与数据数学与科学文档与办公对话与客服+5文本多模态理解智能代理与数据数学与科学文档与办公对话与客服旗舰级全能通用模型,面向 Agent 时代的复杂推理与长链路任务执行场景。强调多模态理解、长上下文推理、结构化生成与工具增强执行。复杂指令与多约束执行能力突出,可稳定应对多步复杂规划、复杂图文推理、视频内容理解与高难度分析等场景。价格多项属性定价多项属性定价输入≤32k¥3.2/M token32k~128k¥4.8/M token128k~256k¥9.6/M token输出≤32k¥16/M token32k~128k¥24/M token128k~256k¥48/M token缓存读≤32k¥0.64/M token32k~128k¥0.96/M token128k~256k¥1.92/M token
Doubao-Seed-2.0-mini调用ID:bytedance/doubao-seed-2-0-mini文本多模态理解对话与客服文档与办公内容创作翻译+5文本多模态理解对话与客服文档与办公内容创作翻译面向低时延、高并发与成本敏感场景,提供极致的模型推理速度。模型效果与Doubao-Seed-1.6相当。支持256k上下文、4档思考长度和多模态理解,适合成本和速度优先的轻量级任务。价格多项属性定价多项属性定价输入≤32k¥0.2/M token32k~128k¥0.4/M token128k~256k¥0.8/M token输出≤32k¥2/M token32k~128k¥4/M token128k~256k¥8/M token缓存读≤32k¥0.04/M token32k~128k¥0.08/M token128k~256k¥0.16/M token
Doubao-Seed-2.0-lite调用ID:bytedance/doubao-seed-2-0-lite文本文档与办公内容创作智能代理与数据多模态理解+4文本文档与办公内容创作智能代理与数据多模态理解面向高频企业场景兼顾性能与成本的均衡型模型,综合能力超越上一代Doubao-Seed-1.8。胜任非结构化信息处理、内容创作、搜索推荐、数据分析等生产型工作,支持长上下文、多源信息融合、多步指令执行与高保真结构化输出。在保障稳定效果的同时显著优化成本。价格多项属性定价多项属性定价输入≤32k¥0.6/M token32k~128k¥0.9/M token128k~256k¥1.8/M token输出≤32k¥3.6/M token32k~128k¥5.4/M token128k~256k¥10.8/M token缓存读≤32k¥0.12/M token32k~128k¥0.18/M token128k~256k¥0.36/M token
GLM-5调用ID:bigmodel/glm-5文本智能代理与数据编程+2文本智能代理与数据编程GLM-5 是智谱新一代的旗舰基座模型,面向 Agentic Engineering 打造,能够在复杂系统工程与长程 Agent 任务中提供可靠生产力。在 Coding 与 Agent 能力上,GLM-5 取得开源 SOTA 表现,在真实编程场景的使用体感逼近 Claude Opus 4.5,擅长复杂系统工程与长程 Agent 任务,是通用 Agent 助手的理想基座。价格多项属性定价多项属性定价输入≤32k¥4/M token32k~不限¥6/M token输出≤32k¥18/M token32k~不限¥22/M token缓存读≤32k¥1/M token32k~不限¥1.5/M token
Doubao-Seed-2.0-Code调用ID:bytedance/doubao-seed-2-0-code文本编程智能代理与数据多模态理解+3文本编程智能代理与数据多模态理解面向真实编程环境优化的 Coding 模型,能稳定调用 Claude Code 等常见 IDE 中的工具。模型特别优化了前端能力,在使用常见的前端框架时能有良好表现。模型支持使用 Skills,可以配合多种自定义技能使用。价格多项属性定价多项属性定价输入≤32k¥3.2/M token32k~128k¥4.8/M token128k~256k¥9.6/M token输出≤32k¥16/M token32k~128k¥24/M token128k~256k¥48/M token缓存读≤32k¥0.64/M token32k~128k¥0.96/M token128k~256k¥1.92/M token
Qwen3-VL-32B-Instruct调用ID:ali/qwen3-vl-32b-instruct文本多模态理解文档与办公数学与科学+3文本多模态理解文档与办公数学与科学Qwen3-VL系列最大尺寸Dense模型的非推理版本,综合表现仅次于Qwen3-VL-235B-Instruct,文档识别和理解能力出色,空间感知与万物识别能力强,视觉2D检测/空间推理能力达到SOTA,适合通用场景下的复杂感知任务。输入¥2/M输出¥8/M上下文128K
Grok 4.1 Fast调用ID:x-ai/grok-4.1-fast文本智能代理与数据对话与客服+2文本智能代理与数据对话与客服Grok 4.1 Fast 是 xAI 最好的代理工具调用模型,在客户支持和深入研究等实际应用场景中表现出色。200 万上下文窗口。输入¥1.4/M输出¥3.5/M上下文2M
Doubao-Seedance-1.5-pro调用ID:bytedance/doubao-seedance-1.5-pro视频生成视频与3D+1视频生成视频与3D豆包视频生成模型Seedance 1.5 pro 作为全球领先的视频生成模型,可生成音画高精同步的视频内容。支持多人多语言对白,全面覆盖环境音、动作音、合成音、乐器音、背景音及人声,支持首尾帧,实现影视级叙事效果,满足影视、漫剧、电商及广告领域的高阶创作需求价格多项属性定价多项属性定价default audio公开价格¥16/M tokendefault silent公开价格¥8/M tokenflex audio公开价格¥8/M tokenflex silent公开价格¥4/M token
通义万相2.6-参考生视频调用ID:ali/wan2.6-r2v视频生成视频与3D+1视频生成视频与3D支持指定人物或任意物品进行参考,精准保持形象和声音的一致性,支持多角色参考合拍。价格多项属性定价多项属性定价视频720P¥0.6/次1080P¥1/次
KlingV2.6调用ID:kling/kling-v2-6视频生成视频与3D+1视频生成视频与3D暂未提供模型说明。价格多项属性定价多项属性定价图像生成视频720p5秒¥1.50/次720p10秒¥3.00/次1080p5秒¥2.50/次1080p10秒¥5.00/次文本生成视频720p5秒¥1.50/次720p10秒¥3.00/次1080p5秒¥2.50/次1080p10秒¥5.00/次
GLM-5V-Turbo调用ID:bigmodel/glm-5v-turbo文本编程智能代理与数据多模态理解+3文本编程智能代理与数据多模态理解GLM-5V-Turbo 是智谱首个多模态 Coding 基座模型,面向视觉编程任务打造。能够原生处理图片、视频、文本等多模态输入,同时擅长长程规划、复杂编程和动作执行;深度适配 Agent 工作流,能够与 Claude Code、OpenClaw 等 Agent 深度协同,完成”看懂环境→规划动作→执行任务”的完整闭环。价格多项属性定价多项属性定价输入≤32k¥5/M token32k~不限¥7/M token输出≤32k¥22/M token32k~不限¥26/M token缓存读≤32k¥1.2/M token32k~不限¥1.8/M token
Step 5 Preview调用ID:stepfun/step-5-preview文本多模态理解智能代理与数据文档与办公编程+4文本多模态理解智能代理与数据文档与办公编程Step 5 Preview 是 StepFun 面向真实任务的新一代旗舰基模,重点覆盖编程与专业知识工作。模型原生支持文本、图片和视频输入,提供 1M tokens 上下文窗口,适合需要处理大量信息、调用工具,并持续推进到交付结果的任务。输入¥7/M输出¥20/M上下文256K
Kling V2.1 Master调用ID:kling/kling-v2-1-master视频生成视频与3D+1视频生成视频与3DKling/Kling v2.1 Master 是快手文生视频大师级版本,主打 1080P 高清输出及 4K 适配,搭载专属动态光影追踪技术,可精准实现多主体动作协同与影视级粒子特效。支持材质细节实时渲染,5 秒 1080P 视频生成仅需 30 秒,兼顾高端画质与效率,适配影视预演、高端广告等场景,还能通过情绪参数调画面氛围,强化叙事感。价格多项属性定价多项属性定价图像生成视频720p5秒¥10.00/次720p10秒¥20.00/次1080p5秒¥10.00/次1080p10秒¥20.00/次文本生成视频720p5秒¥10.00/次720p10秒¥20.00/次1080p5秒¥10.00/次1080p10秒¥20.00/次