模型库
自营国产算力与官方渠道供给的全部模型,价格实时更新。同一个 API Key 调用任意模型。
25 个模型 · 自营算力 3 · 官方接入 22MiniMax H3 视频生成模型:支持文生视频、图生视频(首帧 / 首尾帧)与参考生视频,可输入文本、图片、音频、视频作为参考。输出 768P,默认连同声音一起生成。按成功生成的视频时长计费,正式价 0.50 元/秒,推广期特惠中(实际价格以页面标价为准)。生成失败不计费;参考图、参考音频、参考视频等输入素材限时免费。
MiniMax H3 视频生成模型:支持文生视频、图生视频(首帧 / 首尾帧)与参考生视频,可输入文本、图片、音频、视频作为参考。输出 768P,默认连同声音一起生成。按成功生成的视频时长计费,正式价 0.50 元/秒,推广期特惠中(实际价格以页面标价为准)。生成失败不计费;参考图、参考音频、参考视频等输入素材限时免费。 H3 Fast 由拉模式任务队列调度:提交即返回任务 id,按秒计费。画布只支持 1344x768(16:9,默认)与 768x1344(9:16);时长 5–14 秒(默认 5 秒),成片会按帧网格略长于请求时长(至多约 0.7 秒),按请求秒数计费。其余参数与 MiniMax H3 相同。
GLM-5.3 是 Z.AI GLM 系列的新一代模型,支持最长 1M 上下文与 128K 输出,原生支持深度思考、工具调用与结构化输出,适合长文档理解、代码生成与复杂推理场景。由自营算力提供服务,兼容 OpenAI 与 Anthropic 两种调用协议。
HappyHorse 1.1 图生视频模型:给一张图和文字描述,生成一段视频。任务式异步生成。按成功生成的视频时长计费:720P 0.36 元/秒、1080P 0.48 元/秒,生成失败不计费。
HappyHorse 1.1 参考生视频模型:给若干参考图或参考视频,按描述生成新视频。任务式异步生成。按成功生成的视频时长计费:720P 0.36 元/秒、1080P 0.48 元/秒,生成失败不计费。
HappyHorse 1.1 文生视频模型,任务式异步生成(提交→轮询→下载)。按成功生成的视频时长计费:720P 0.36 元/秒、1080P 0.48 元/秒,生成失败不计费。
通义千问文生图模型,按成功生成张数计费(0.2 元/张),失败不计费。
通义千问语音识别模型,音频输入(base64 ≤10MB 或公网 URL),输出转写文本不计费。
通义千问语音合成模型,按输入字符计费(0.1 元/千字符),支持多音色(voice 参数,默认 Cherry)。
通义千问视觉理解模型,支持图像输入与思考模式。
通义千问全模态理解模型(音频/图片/视频输入,必须流式调用)。定位音频/多模态理解:输出统一按多模态价计费,纯文本调用同价;音频输入按官方 7 token/秒折算单独计价。
通义千问轻量低成本模型,效果接近旗舰,百万 token 上下文。
通义千问旗舰模型,推理能力最强,百万 token 上下文。
通义千问均衡模型,支持思考模式,百万 token 上下文。
通义千问 3.7 文本向量模型,将文本转成稠密向量用于检索、聚类与语义匹配,按输入字符量计费 0.25 元每百万。
通义千问 3.8 旗舰对话模型:2.4 万亿参数 MoE,编程与办公能力全面跃升,原生视觉理解,支持超长文档与长视频的深度语义解析,可自主编排多步任务并持续进化。支持深度思考、工具调用、结构化输出与联网搜索。
通义实验室文本向量模型 text-embedding-v4:支持中英等多语种,向量维度可选(2048/1024/768/512),适用于语义检索、RAG、聚类与分类。
通义万相文生视频模型,任务式异步生成(提交→轮询→下载),按成功生成的视频时长计费(720P 0.6 元/秒,支持 5/10 秒),失败不计费。
通义万相 2.7 图生视频模型:给一张图和文字描述,生成一段视频。任务式异步生成(提交→轮询→下载)。按成功生成的视频时长计费:720P 0.3 元/秒、1080P 0.5 元/秒,生成失败不计费。
通义万相 2.7 图像生成模型,根据文字描述生成图片,按成功生成的张数计费 0.10 元每张。
通义万相 2.7 参考生视频模型:给若干参考图或参考视频,按描述生成新视频。任务式异步生成。按成功生成的视频时长计费:720P 0.3 元/秒、1080P 0.5 元/秒,生成失败不计费。
通义万相 2.7 文生视频模型,任务式异步生成(提交→轮询→下载)。按成功生成的视频时长计费:720P 0.3 元/秒、1080P 0.5 元/秒,生成失败不计费。
通义万相 3.0 全能视频生成模型:一个模型同时支持文生视频、图生视频(首帧 / 首尾帧)与参考生视频,可同时输入文本、图片、视频与音频作为参考。最长 30 秒,480P / 720P / 1080P 三档分辨率,默认连同声音一起生成(开关声音价格相同)。按成功生成的视频时长计费,生成失败不计费。
通义万相 3.0 高速版视频生成模型:能力对齐标准版(文生视频、图生视频、参考生视频,可同时输入文本、图片、视频与音频),端到端生成速度显著更快。最长 30 秒,480P / 720P / 1080P 三档分辨率,默认连同声音一起生成。按成功生成的视频时长计费,生成失败不计费。
GLM-5.2 supports a larger context window and output length, with up to 1M context and 128K output tokens. It adds streaming output for tool calls via `tool_stream=true`, enabling real-time access to tool call arguments. Like the GLM-4.7 series, it supports deep thinking with `thinking={ type: "enabled" }`, where thinking is enforced once enabled, and introduces `reasoning_effort` to control reasoning intensity under chain-of-thought mode. It also delivers stronger coding performance and more advanced reason