Claude 3.5 HaikuAPI ID:anthropic/claude-3.5-haiku文本多模态理解对话与客服内容创作文档与办公编程+5文本多模态理解对话与客服内容创作文档与办公编程Claude 3.5 Haiku是Anthropic最快且最具成本效益的下一代模型,非常适合速度和经济性重要的应用场景。PriceAttribute-based pricingAttribute-based pricing缓存写(5m)Public price¥7/M token缓存写(1h)Public price¥11.2/M token
Agnes 3.0 FlashAPI ID:agnes/agnes-3.0-flash文本智能代理与数据编程+2文本智能代理与数据编程Agnes 3.0 Flash 是 Agnes AI 推出的全新一代升级文本模型,面向 Agent 编程与工具驱动任务,重点提升复杂任务的端到端执行质量。Input¥0/MOutput¥0/MContext512K
Gemini 2.5 Flash Nativa AudioAPI ID:google/gemini-2.5-flash-live文本语音处理对话与客服多模态理解翻译+4文本语音处理对话与客服多模态理解翻译Gemini 2.5 Flash 的原生音频模型,支持Live API格式调用。Input¥3.5/MOutput¥14/MContext1M
Qwen-PlusAPI ID:ali/qwen-plus-latest文本对话与客服内容创作文档与办公编程学术与教育+5文本对话与客服内容创作文档与办公编程学术与教育通义千问系列能力均衡的模型,推理效果、成本和速度介于通义千问-Max和通义千问-Turbo之间,适合中等复杂任务。Input¥0.8/MOutput¥2/MContext131.1K
ERNIE-4.0-Turbo-128KAPI ID:baidu/ernie-4.0-turbo-128k文本文档与办公多模态理解内容创作编程学术与教育+5文本文档与办公多模态理解内容创作编程学术与教育百度自研的旗舰级超大规模⼤语⾔模型,综合效果表现出色,广泛适用于各领域复杂任务场景;支持自动对接百度搜索插件,保障问答信息时效。相较于ERNIE 4.0在性能表现上更优秀Input¥3/MOutput¥9/MContext124K
InternVL3.5API ID:intern/internvl3.5文本多模态理解+1文本多模态理解最新的发布的通用多模态大模型系列,拥有卓越的图文推理能力。Input¥0/MOutput¥0/MContext128K
Agnes 2.5 FlashAPI ID:agnes/agnes-2.5-flash文本多模态理解智能代理与数据编程对话与客服+4文本多模态理解智能代理与数据编程对话与客服Agnes 2.5 Flash 是基于 Agnes 2.0 Flash 升级的全量可用语言模型。它沿用 OpenAI 兼容的 Chat Completions 接入方式,同时在编码任务、智能体工作流、工具调用、多轮对话、推理和图像理解体验上进行了优化。Input¥0/MOutput¥0/MContext512K
Intern-S1-ProAPI ID:intern/intern-s1-pro文本多模态理解智能代理与数据数学与科学学术与教育+4文本多模态理解智能代理与数据数学与科学学术与教育先进开源多模态推理模型,综合性能优秀,支持内置联网搜索能力Input¥0/MOutput¥0/MContext128K
Intern-S1API ID:intern/intern-s1文本多模态理解数学与科学学术与教育+3文本多模态理解数学与科学学术与教育融合了专业科学能力的多模态大模型Input¥0/MOutput¥0/MContext128K
GLM-4.5-AirXAPI ID:bigmodel/glm-4.5-airx文本对话与客服内容创作文档与办公+3文本对话与客服内容创作文档与办公GLM-4.5-AirX为GLM-4.5-Air的极速版,响应速度更快,专为大规模高速度需求打造。PriceAttribute-based pricingAttribute-based pricing输入≤32k¥4/M token≤32k¥4/M token32k~不限¥8/M token输出≤2k¥12/M token2k~不限¥16/M token全部¥32/M token缓存读全部¥0.8/M token全部¥0.8/M token全部¥1.6/M token
Intern-S2-PreviewAPI ID:intern/intern-s2-preview文本多模态理解智能代理与数据数学与科学学术与教育+4文本多模态理解智能代理与数据数学与科学学术与教育我们最新发布的 35B-A3B 科学多模态推理模型,支持 256K 上下文窗口;通过任务 scaling 与架构优化,重点提升科学发现和通用智能体能力。Input¥0/MOutput¥0/MContext128K
Agnes 2.0 FlashAPI ID:agnes/agnes-2.0-flash文本智能代理与数据多模态理解编程对话与客服+4文本智能代理与数据多模态理解编程对话与客服Agnes 2.0 Flash 是 Agnes AI 的快速高效语言模型,适合智能体工作流、工具调用、编码、多轮对话、推理和图像理解等高频生产场景。Input¥0/MOutput¥0/MContext512K
Qwen-Turbo (Thinking)API ID:ali/qwen-turbo-latest:thinking文本对话与客服内容创作文档与办公编程翻译+5文本对话与客服内容创作文档与办公编程翻译Qwen-Turbo基于Qwen2.5开发,具有速度快、成本低的特点,适用于处理简单任务。Input¥0.3/MOutput¥3/MContext131.1K
Qwen-TurboAPI ID:ali/qwen-turbo-latest文本对话与客服文档与办公内容创作翻译智能代理与数据+5文本对话与客服文档与办公内容创作翻译智能代理与数据Qwen-Turbo基于Qwen2.5开发,是一款支持100万token上下文长度的大模型,具有速度快、成本低的特点,适用于处理简单任务。Input¥0.3/MOutput¥0.6/MContext1M
Qwen-Plus (Thinking)API ID:ali/qwen-plus-latest:thinking文本对话与客服文档与办公编程数学与科学智能代理与数据+5文本对话与客服文档与办公编程数学与科学智能代理与数据Qwen-Plus 基于 Qwen2.5 基础模型构建,是一款支持 131K 上下文长度的大模型,在性能、速度与成本之间实现了良好平衡。PriceAttribute-based pricingAttribute-based pricing输入≤128k¥0.8/M token128k~256k¥2.4/M token256k~1000k¥4.8/M token输出≤128k¥8/M token128k~256k¥24/M token256k~1000k¥48/M token缓存读≤128k¥0.16/M token128k~256k¥0.48/M token256k~1000k¥0.96/M token显式缓存命中≤128k¥0.08/M token128k~256k¥0.24/M token256k~1000k¥0.48/M token缓存写(5m)≤128k¥1/M token128k~256k¥3/M token256k~1000k¥6/M token
DeepSeek-V3API ID:deepseek/deepseek-v3文本翻译编程数学与科学学术与教育文档与办公翻译+6文本翻译编程数学与科学学术与教育文档与办公翻译DeepSeek-V3是DeepSeek公司发布的一款大型语言模型,以其在数学、编码和中文等任务上的卓越性能而闻名。该模型采用了MoE架构,拥有6710亿参数,每个token激活的参数量为370亿,并且支持128K token的超长上下文窗口。DeepSeek-V3不仅在性能上对标GPT-4o等主流模型,还在推理速度和效率上取得了显著提升。Input¥2/MOutput¥8/MContext65.5K
ERNIE-4.5-Turbo-128KAPI ID:baidu/ernie-4.5-turbo-128k文本多模态理解文档与办公对话与客服+3文本多模态理解文档与办公对话与客服模型能力全面提升,更好满足多轮长历史对话处理、长文档理解问答任务。Input¥0.8/MOutput¥3.2/MContext128K
Grok 3API ID:x-ai/grok-3文本编程智能代理与数据文档与办公多模态理解+4文本编程智能代理与数据文档与办公多模态理解Grok 3是Grok的第三代版本,在数据提取、编码和文本摘要等企业用例中表现出色。Input¥21/MOutput¥105/MContext131.1K
ERNIE-4.5-Turbo-128K-PreviewAPI ID:baidu/ernie-4.5-turbo-preview文本文档与办公对话与客服多模态理解+3文本文档与办公对话与客服多模态理解模型能力全面提升,更好满足多轮长历史对话处理、长文档理解问答任务。Input¥0.8/MOutput¥3.2/MContext128K
GPT OSS 120BAPI ID:openai/gpt-oss-120b文本智能代理与数据多模态理解编程数学与科学文档与办公+5文本智能代理与数据多模态理解编程数学与科学文档与办公GPT OSS 120B是OpenAI推出的开放权重、包含1170亿个参数的MoE语言模型,专为高推理、代理和通用生产用例而设计。它每次前向传递可激活51亿个参数,并经过优化,可在具有原生MXFP4量化的单个H100 GPU上运行。Input¥0.7/MOutput¥3.5/MContext131.1K
GPT OSS 20BAPI ID:openai/gpt-oss-20b文本智能代理与数据多模态理解对话与客服+3文本智能代理与数据多模态理解对话与客服GPT OSS 20B是OpenAI发布的开放权重210亿参数模型,它采用MoE架构,每次前向传递有36亿个有效参数,并针对低延迟推理和在消费级或单GPU硬件上的部署进行了优化。该模型采用OpenAI的Harmony响应格式进行训练,并支持推理级别配置、微调和代理功能,包括函数调用、工具使用和结构化输出。Input¥0.35/MOutput¥1.4/MContext131.1K
ERNIE-4.5-Turbo-32KAPI ID:baidu/ernie-4.5-turbo-32k文本内容创作多模态理解学术与教育对话与客服+4文本内容创作多模态理解学术与教育对话与客服文本创作、知识问答等能力提升显著。输出长度及整句时延相较ERNIE 4.5有所增加。Input¥0.8/MOutput¥3.2/MContext32K
ERNIE-4.5-Turbo-VL-PreviewAPI ID:baidu/ernie-4.5-turbo-vl-preview文本多模态理解内容创作翻译编程+4文本多模态理解内容创作翻译编程文心一言大模型全新版本,图片理解、创作、翻译、代码等能力显著提升,首次支持32K上下文长度,首Token时延显著降低。Input¥3/MOutput¥9/MContext128K
Llama 3.3 70B InstructAPI ID:meta/llama-3.3-70b-instruct文本对话与客服翻译内容创作文档与办公学术与教育+5文本对话与客服翻译内容创作文档与办公学术与教育Meta Llama 3.3 是一款多语言大语言模型,在 70B 参数规模下进行了预训练与指令微调,支持文本输入与输出。该模型专为多语言对话场景优化,具备强大的生成与理解能力。Input¥0.84/MOutput¥2.1/MContext128K