OpenAI / GPT-5调用ID:openai/gpt-5文本编程数学与科学多模态理解智能代理与数据GPT-5是OpenAI推出的最新一代先进模型,在推理能力、代码生成质量和用户体验方面实现显著提升。该模型针对复杂任务进行了专项优化,尤其擅长需要逐步推理、精准遵循指令以及对准确性要求严格的高风险场景。
Kling / KlingV2.1调用ID:kling/kling-v2-1视频生成视频与3DKling v2.1 是快手研发的文 / 图生视频模型,搭载 3D 时空注意力机制,能精准还原动态细节,支持 720P/1080P、24fps 输出。内置 10 + 运镜与多艺术风格,可自动补连贯动作、生成同步音效
Kling / Kling V2.1 Master调用ID:kling/kling-v2-1-master视频生成视频与3DKling/Kling v2.1 Master 是快手文生视频大师级版本,主打 1080P 高清输出及 4K 适配,搭载专属动态光影追踪技术,可精准实现多主体动作协同与影视级粒子特效。支持材质细节实时渲染,5 秒 1080P 视频生成仅需 30 秒,兼顾高端画质与效率,适配影视预演、高端广告等场景,还能通过情绪参数调画面氛围,强化叙事感。
xAI / Grok 4.7调用ID:x-ai/grok-4.7文本智能代理与数据文档与办公编程Grok 4.7是SpaceXAI面向代码编写、智能代理任务以及知识类工作推出的旗舰模型,为Grok 4.6的迭代版本。该模型在长时间软件工程任务、自我工作校验以及长上下文处理方面表现突出,相较于前代产品,在文档撰写、演示文稿制作等专业知识工作上的能力有所提升。
ByteDance / Doubao-Seed-1.8调用ID:bytedance/doubao-seed-1.8文本多模态理解智能代理与数据对话与客服全新面向多模态 Agent 场景定向优化模型。更强Agent能力、升级多模态理解、更灵活的上下文管理。
Vidu / Vidu2.0调用ID:vidu/vidu2.0视频生成视频与3Dvidu/vidu2.0 是清华与生数科技联合研发的文生视频模型,核心搭载全球首创 U-ViT 架构,10 秒内即可生成 4 秒视频,单秒成本仅 4 分钱。支持 16 秒 1080P 输出,能精准控制多主体动态一致性,内置物理引擎还原毫米级运动细节,还深度适配国风等文化元素
Bytedance / Doubao-Seedance-1.0-lite-i2v调用ID:bytedance/doubao-seedance-1.0-lite-i2v视频生成视频与3DDoubao-Seedance-1.0-lite-i2v,根据首帧图片、尾帧图片(可选)、参考图片(可选)和文本描述(可选)生成视频。是兼顾生成效果与速度的性价比之选。该模型语义理解与指令遵循能力强。运镜专业。支持多种视频风格,可以丝滑兼容各种风格的首图。分辨率支持480P、720P、1080P,时长支持3-12s,帧率24fps
Bytedance / Doubao-Seedance-1.0-lite-t2v调用ID:bytedance/doubao-seedance-1.0-lite-t2v视频生成视频与3D内容创作bytedance/doubao-seedance-1.0-lite-t2v 是字节跳动轻量级文生视频模型,支持文 / 图生视频,含专业运镜、多艺术风格,输出 480P/720P、24fps。适用于电商营销、影视预演、创意内容制作
OpenAI / GPT-Image调用ID:openai/gpt-image-1图像生成图像与设计OpenAI最强图像生成模型,新模型能够结合世界知识,生成更加符合上下文图像,质量更高,还支持多种功能自定义。
JiMeng / 即梦3.0-图生视频-首帧-720P调用ID:bytedance/jimeng_i2v_first_v30视频生成视频与3D内容创作jimeng/即梦3.0-图生视频-首帧-720p是专注首帧驱动的图生视频模型,以输入首帧为基础生成动态内容,支持720p高清输出。能精准延续首帧的画面风格、元素细节(如人物肌理、场景光影),生成的视频动作自然、场景元素连贯不跳帧,适配创意短视频、动态海报等场景,兼顾生成效率与画面质感,满足轻量级动态创作需求。
StepFun / Step 3.7 Flash调用ID:stepfun/step-3.7-flash文本多模态理解Step 3.7 Flash 是阶跃星辰推出的旗舰多模态推理模型,基于 198B 总参数 / 11B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解,具备 256K tokens 长上下文和高速低延迟的推理能力。
Moonshot / Kimi K2.7 Code HighSpeed调用ID:moonshot/kimi-k2.7-code-highspeed文本编程Kimi K2.7 Code HighSpeed 是 Kimi K2.7 Code 的高速版模型,与 Kimi K2.7 Code 是相同模型,但输出速度约 180 Tokens/s,短上下文场景可达 260 Token/s,带来更极致的编程体验。
Ali / Qwen3-Omni-Flash调用ID:ali/qwen3-omni-flash文本对话与客服内容创作翻译编程文档与办公Qwen-Omni 模型能够接收文本、图片、音频、视频等多种模态的组合输入,并生成文本或语音形式的回复, 提供多种拟人音色,支持多语言和方言的语音输出,可应用于文本创作、视觉识别、语音助手等场景。
JiMeng / 即梦4.0调用ID:bytedance/jimeng_v40图像生成图像与设计多模态理解即梦4.0是即梦同源的图像生成能力,该能力在统一框架内集成了文生图、图像编辑及多图组合生成的功能:支持单次输入最多 10 张图像及进行复合编辑,并能通过对提示词的深度推理,智能适配最优的图像比例尺寸与生成数量,可一次性输出最多 15 张内容关联的图像。此外,模型显著提升了中文生成的准确率与内容多样性,且支持 4K 超高清输出,为专业图像创作提供了从生成到编辑的一站式解决方案。
Ali / Qwen3-Max调用ID:ali/qwen3-max文本编程数学与科学智能代理与数据多模态理解翻译Qwen3-Max 是在 Qwen3 系列的基础上构建的更新版本,与 2025 年 1 月版本相比,在推理、指令遵循、多语言支持和长尾知识覆盖方面进行了重大改进。它在数学、编码、逻辑和科学任务中提供更高的准确性,更可靠地遵循复杂的中文和英文指令,减少幻觉,并为开放式问答、写作和对话提供更高质量的回答。该模型支持 100 多种语言,具有更强的翻译和常识推理能力,并针对检索增强生成 (RAG) 和工具调用进行了优化,尽管它不包括专用的“思考”模式。
Ali / Qwen-VL-OCR调用ID:ali/qwen-vl-ocr文本多模态理解文档与办公图像与设计通义千问VL-OCR(qwen-vl-ocr),即基于Qwen-VL训练的OCR识别大模型。通过统一模型的方式聚合多种图文识别、解析、处理类任务,提供强大的图文识别能力。
DeepSeek / DeepSeek-OCR调用ID:deepseek/deepseek-ocr文本图像与设计多模态理解文档与办公DeepSeek-OCR 是 DeepSeek AI 发布的视觉语言模型,旨在探索视觉-文本压缩边界,专注于文档识别及图像转文本场景的解决方案 。该模型可将长文本渲染为高压缩比图像,在 10 倍无损压缩下能实现 97% 的 OCR 准确率,即使压缩到 20 倍也能保持约 60% 的准确率。
Ali / Qwen3-VL-Plus调用ID:ali/qwen3-vl-plus文本多模态理解图像与设计视频与3D智能代理与数据编程Qwen3系列视觉理解模型,实现思考模式和非思考模式的有效融合,视觉智能体能力在OS World等公开测试集上达到世界顶尖水平。此版本在视觉coding、空间感知、多模态思考等方向全面升级;视觉感知与识别能力大幅提升,支持超长视频理解。
StepFun / Step 5 Preview调用ID:stepfun/step-5-preview文本多模态理解智能代理与数据文档与办公编程Step 5 Preview 是 StepFun 面向真实任务的新一代旗舰基模,重点覆盖编程与专业知识工作。模型原生支持文本、图片和视频输入,提供 1M tokens 上下文窗口,适合需要处理大量信息、调用工具,并持续推进到交付结果的任务。