7ART

7ART 上的 AI 模型

75 视频、图像、音乐、语音、虚拟形象和 3D 生成引擎——集成于单一工作流程,共享同一“积分”余额。一旦获得 API 访问权限,我们将尽快添加新的顶级模型。

下文中列出的所有时长、输出等级和价格均为 7ART 针对该模型提供的服务及收费标准——数据源自该工作室的官方表格,而非供应商的产品规格表。

今日目录中

22 视频 · 25 图片 · 6 音乐 · 11 语音与音频 · 5 虚拟形象与口型同步 · 6 3d

01 / 视频

视频模型

它们在几乎所有方面都存在分歧——片段长度、分辨率上限、是否采用参考视频等——因此每张卡片所体现的是差异,而非产品定位。

打开视频工作室
7Video 关于 7ART视频7ART 预设
7ART

7Video

7ART 的旗舰视频预设——我们提供最佳视频质量,经过精心调校,并作为同一选择器中的一个选项进行定价。

时长
5–15秒
质量
768P / 2K
输入内容
起始帧与结束帧,或图像/视频/音频参考素材

积分

比基础引擎费率高出 10%

查看模型
Gemini Omni Flash 关于 7ART视频
Google

Gemini Omni Flash

由谷歌多模态模型驱动,完全基于其自身的参考素材库——包括图片、视频片段、已保存的角色和语音,不使用提示卡。

时长
4、6、8 或 10 秒
输出等级
720p / 1080p / 4K
方面
16:9 或 9:16

积分

90 / 120 / 150 / 180,对应 4 / 6 / 8 / 10 秒,分辨率为 720p 或 1080p · 210 / 240 / 270 / 300(4K分辨率)· 固定240(720p/1080p)或360(4K),需提供视频参考

查看模型
VEO 关于 7ART视频
Google3 模型

VEO

3.1 Quality: 谷歌外观最精美的电影级效果,按每次生成统一计费,而非按秒计费。

时长
4、6 或 8 秒
质量
预览 / 1080p / 4K
输入内容
起始帧 + 结束帧
  • 3.1 Quality
  • 3.1 Fast
  • 3.1 Lite

积分 · 3.1 Quality

每次生成固定配额:250 次预览 · 255 次 1080p 渲染 · 370 次 4K 渲染

查看模型
Seedance 关于 7ART视频
4 模型

Seedance

2.5: 工作室中最长的视频片段、随视频生成的音频,以及迄今为止最广泛的参考集——最高支持 1080p(无 4K 级别)。

时长
4–30s
质量
480p / 720p / 1080p
参考文献
30 张图片 · 10 段视频 · 10 段音频
  • 2.5
  • 2.0
  • 2.0 Fast
  • 2.0 Mini

积分 · 2.5

480p 分辨率下 37 帧/秒 · 720p 分辨率下 79 帧/秒 · 1080p 分辨率下 208 帧/秒

查看模型
Kling 关于 7ART视频
Kling AI5 模型

Kling

3.0: 功能最强大的 Kling 版本——包含角色、音画同步、多镜头以及 4K 画质选项。

时长
3–15秒
质量
720p / 1080p / 4K
输入内容
起始帧;多帧序列外的结束帧
  • 3.0
  • 3.0 Turbo
  • 2.6
  • 2.5 Turbo
  • +1 更多

积分 · 3.0

720p 分辨率下每秒 14 个 · 1080p 分辨率下每秒 18 个 · 带音频时每秒 20/27 个 · 4K 分辨率下每秒 67 个

查看模型
Grok Imagine (video) 关于 7ART视频
xAI

Grok Imagine (video)

支持动态效果、文本生成以及图片转视频功能,且在该工作室中每秒生成成本最低。

时长
6–30s
质量
480p / 720p
输入内容
起始帧

积分

480p 分辨率下每秒 1.6 帧 · 720p 分辨率下每秒 3 帧

查看模型
MiniMax H3 关于 7ART视频
MiniMax

MiniMax H3

四种质量等级——480P 至 4K——首帧至末帧,以及图像、视频和音频参考素材。

时长
5–15秒
质量
480P / 768P / 2K / 4K
输入内容
起始帧 + 结束帧,或 9 张图片 / 3 段视频 / 3 段音频

积分

480P 分辨率下每秒 10 张 · 768P 分辨率下每秒 22.5 张 · 2K 分辨率下每秒 36.5 张 · 4K 分辨率下每秒 32 张,此外还需加上参考视频本身的时长,以及超过前 5 张后的每张参考图片消耗 11 个积分

查看模型
HappyHorse 1.1 关于 7ART视频
Alibaba

HappyHorse 1.1

文本、图片或视频的多重引用——仅限图片,不得引用视频或音频内容。

时长
3–15秒
质量
720p / 1080p
输入内容
起始帧或参考图片

积分

720p 分辨率下 33 帧/秒 · 1080p 分辨率下 44 帧/秒

查看模型
Wan 关于 7ART视频
3 模型

Wan

2.7: 集四种模式于一体——文本转视频、图片转视频、视频编辑和参考素材转视频——并支持驱动音频、提示词扩展和反向提示词。

时长
5、10 或 15 秒
质量
720p / 1080p
输入内容
起始帧、结束帧、参考视频、驱动音频
  • 2.7
  • 2.6
  • 2.5

积分 · 2.7

720p 分辨率下 16 帧/秒 · 1080p 分辨率下 24 帧/秒

查看模型
MMAudio v2 关于 7ART视频

MMAudio v2

为没有音效的片段生成音效轨道。

输出
音频已复用到源片段中

积分

每次运行固定费用为 5 点

查看模型
Luma Ray-2 Modify 关于 7ART视频
Luma

Luma Ray-2 Modify

对现有片段进行端到端的风格重塑。

输出
整个源文本片段,经重新排版

积分

每次运行固定费用 600

查看模型
所有 22 视频 引擎,包含各项规格与价格
模型用途规格积分
7Video7ART7ART 的旗舰视频预设——我们提供最佳视频质量,经过精心调校,并作为同一选择器中的一个选项进行定价。
  • 时长: 5–15秒
  • 质量: 768P / 2K
  • 输入内容: 起始帧与结束帧,或图像/视频/音频参考素材
比基础引擎费率高出 10%
Gemini Omni FlashGoogle由谷歌多模态模型驱动,完全基于其自身的参考素材库——包括图片、视频片段、已保存的角色和语音,不使用提示卡。在 7ART 选择器中列为“Gemini Omni Video”——该名称源自我们的提供商端点,而非 Google。
  • 时长: 4、6、8 或 10 秒
  • 输出等级: 720p / 1080p / 4K
  • 方面: 16:9 或 9:16
  • 参考文献: 7 张图片 · 1 个视频片段 · 3 个角色 · 3 种声音
90 / 120 / 150 / 180,对应 4 / 6 / 8 / 10 秒,分辨率为 720p 或 1080p · 210 / 240 / 270 / 300(4K分辨率)· 固定240(720p/1080p)或360(4K),需提供视频参考
VEO 3.1 QualityGoogle谷歌外观最精美的电影级效果,按每次生成统一计费,而非按秒计费。
  • 时长: 4、6 或 8 秒
  • 质量: 预览 / 1080p / 4K
  • 输入内容: 起始帧 + 结束帧
每次生成固定配额:250 次预览 · 255 次 1080p 渲染 · 370 次 4K 渲染
VEO 3.1 FastGoogle更快的 VEO 版本,也是唯一支持上传参考照片的套餐。
  • 时长: 4、6 或 8 秒
  • 质量: 预览 / 1080p / 4K
  • 输入内容: 起始帧和结束帧,或最多 3 张参考照片
每次生成固定配额:60 次预览 · 65 次 1080p 渲染 · 180 次 4K 渲染
VEO 3.1 LiteGoogle经济实惠的 VEO —— 非常适合进行实验。
  • 时长: 4、6 或 8 秒
  • 质量: 预览 / 1080p / 4K
  • 输入内容: 起始帧 + 结束帧
每次生成固定配额:30 次预览 · 35 次 1080p 分辨率 · 150 次 4K 分辨率
Seedance 2.5ByteDance工作室中最长的视频片段、随视频生成的音频,以及迄今为止最广泛的参考集——最高支持 1080p(无 4K 级别)。
  • 时长: 4–30s
  • 质量: 480p / 720p / 1080p
  • 参考文献: 30 张图片 · 10 段视频 · 10 段音频
  • 方面: 21:9、16:9、4:3、1:1、3:4、9:16 或自动
480p 分辨率下 37 帧/秒 · 720p 分辨率下 79 帧/秒 · 1080p 分辨率下 208 帧/秒
Seedance 2.0ByteDance具有强烈身份一致性的真实人物以及电影级的多镜头序列;这是唯一支持 4K 渲染的 Seedance 等级。
  • 时长: 4–15 秒
  • 质量: 480p / 720p / 1080p / 4K
  • 参考文献: 9 张图片 · 3 段视频 · 3 段音频
480p / 720p / 1080p / 4K 分辨率下,每秒分别为 19 / 41 / 102 / 311 · 带视频参考时,每秒 11.5 / 25 / 62 次(按输入+输出秒数计算)(4K 无带视频参考的速率)
Seedance 2.0 FastByteDance草稿和预览阶段使用 Lighter Seedance 2.0。
  • 时长: 4–15 秒
  • 质量: 480p / 720p
  • 参考文献: 9 张图片 · 3 段视频 · 3 段音频
480p 分辨率下每秒 15.5 次 · 720p 分辨率下每秒 33 次 · 使用视频参考时,每秒 9/20 次(按输入+输出秒数计算)
Seedance 2.0 MiniByteDance最便宜的 Seedance 套餐。
  • 时长: 4–15秒
  • 质量: 480p / 720p
  • 参考文献: 9 张图片 · 3 段视频 · 3 段音频
480p 分辨率下 9.5 帧/秒 · 720p 分辨率下 20.5 帧/秒 · 使用视频参考时,每秒 6 / 12.5 帧(以输入和输出秒数为准)
Kling 3.0Kling AI功能最强大的 Kling 版本——包含角色、音画同步、多镜头以及 4K 画质选项。
  • 时长: 3–15秒
  • 质量: 720p / 1080p / 4K
  • 输入内容: 起始帧;多帧序列外的结束帧
  • 音频: 可选 — 提高每秒生成速率
720p 分辨率下每秒 14 个 · 1080p 分辨率下每秒 18 个 · 带音频时每秒 20/27 个 · 4K 分辨率下每秒 67 个
Kling 3.0 TurboKling AIFaster Kling 3.0,支持文本及图片转视频。
  • 时长: 3–15秒
  • 质量: 720p / 1080p
  • 输入内容: 起始帧
720p 分辨率下每秒 18 帧 · 1080p 分辨率下每秒 22.5 帧
Kling 2.6Kling AI可靠且在动画方面表现出色,并带有声音。
  • 时长: 5 或 10s
  • 质量: 720p / 1080p
  • 输入内容: 起始帧
每秒 11 条 · 含音频时每秒 22 条
Kling 2.5 TurboKling AI最快、最经济的草稿生成引擎。
  • 时长: 5 或 10s
  • 质量: 720p
  • 输入内容: 起始帧
9/秒
Kling 3.0 Motion ControlKling AI动作转移——提取一个片段中的动作,并将其应用到新的主体上。在 Motion 工作室中运行,而非视频模型选择器。
  • 质量: 720p / 1080p
  • 输入内容: 起始帧
720p 分辨率下每秒 20 帧 · 1080p 分辨率下每秒 27 帧
Grok Imagine (video)xAI支持动态效果、文本生成以及图片转视频功能,且在该工作室中每秒生成成本最低。
  • 时长: 6–30s
  • 质量: 480p / 720p
  • 输入内容: 起始帧
480p 分辨率下每秒 1.6 帧 · 720p 分辨率下每秒 3 帧
MiniMax H3MiniMax四种质量等级——480P 至 4K——首帧至末帧,以及图像、视频和音频参考素材。仅当没有起始帧时才会发送参考信息——当其中一个面板正在使用时,另一个面板会隐藏该信息。
  • 时长: 5–15秒
  • 质量: 480P / 768P / 2K / 4K
  • 输入内容: 起始帧 + 结束帧,或 9 张图片 / 3 段视频 / 3 段音频
  • 方面: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
480P 分辨率下每秒 10 张 · 768P 分辨率下每秒 22.5 张 · 2K 分辨率下每秒 36.5 张 · 4K 分辨率下每秒 32 张,此外还需加上参考视频本身的时长,以及超过前 5 张后的每张参考图片消耗 11 个积分
HappyHorse 1.1Alibaba文本、图片或视频的多重引用——仅限图片,不得引用视频或音频内容。
  • 时长: 3–15秒
  • 质量: 720p / 1080p
  • 输入内容: 起始帧或参考图片
720p 分辨率下 33 帧/秒 · 1080p 分辨率下 44 帧/秒
Wan 2.7集四种模式于一体——文本转视频、图片转视频、视频编辑和参考素材转视频——并支持驱动音频、提示词扩展和反向提示词。
  • 时长: 5、10 或 15 秒
  • 质量: 720p / 1080p
  • 输入内容: 起始帧、结束帧、参考视频、驱动音频
720p 分辨率下 16 帧/秒 · 1080p 分辨率下 24 帧/秒
Wan 2.6转换现有视频;多场景。
  • 时长: 5、10 或 15 秒
  • 质量: 720p / 1080p
  • 输入内容: 起始帧、参考视频
720p 分辨率下每秒 14 帧 · 1080p 分辨率下每秒 21 帧
Wan 2.5可将简短的提示语扩展为更丰富的描述。
  • 时长: 5 或 10s
  • 质量: 720p / 1080p
  • 输入内容: 起始帧
720p 分辨率下每秒 12 帧 · 1080p 分辨率下每秒 20 帧
MMAudio v2为没有音效的片段生成音效轨道。该功能通过片段的编辑操作触发,而非通过模型选择器。
  • 输出: 音频已复用到源片段中
每次运行固定费用为 5 点
Luma Ray-2 ModifyLuma对现有片段进行端到端的风格重塑。该功能通过片段的编辑操作触发,而非通过模型选择器。
  • 输出: 整个源文本片段,经重新排版
每次运行固定费用 600

02 / 图片

图像模型

此处的参考图片数量是指主要提供商实际收到的数量,这并不总是上传框允许您上传的数量。无论其分辨率标签如何标注,FLUX 在每个等级上渲染的图片分辨率约为 1 MP。

打开图像工作室
7Image 关于 7ART图片7ART 预设
7ART

7Image

7ART 的旗舰图像预设——我们的最佳图像质量,被固定在同一选择器顶部。

分辨率
1K / 2K / 4K
参考文献
最多 16

积分

比基础引擎费率高出 10%

查看模型
Nano Banana 关于 7ART图片
Google2 模型

Nano Banana

2: 最多可提供 14 张参考图片——这是确保面部特征一致性的最稳妥选择。

分辨率
1K / 2K / 4K
参考文献
最多 14
  • 2
  • Pro

积分 · 2

每张图片 16 / 24 / 32,分辨率分别为 1K / 2K / 4K

查看模型
Seedream 关于 7ART图片
ByteDance3 模型

Seedream

5 Lite: 经济实惠且快捷。

分辨率
2K / 3K
参考文献
最多 10
  • 5 Lite
  • 4.5
  • 4.0

积分 · 5 Lite

6 张 2K 分辨率图片 · 8 张 3K 分辨率图片

查看模型
GPT Image 2.5 关于 7ART图片
OpenAI2 模型

GPT Image 2.5

Flare: 默认使用 GPT Image 2.5。修改仅限于您要求的内容,主题、构图和背景保持不变。

分辨率
1K / 2K / 4K
参考文献
最多 16
  • Flare
  • Sunburst

积分 · Flare

每张图片起价 7 积分。16:9 宽屏图片在 1K 分辨率下需 9 积分,2K 分辨率下需 12 积分,4K 分辨率下需 21 积分;正方形图片价格更高,最高可达 36 积分。

查看模型
GPT Image 2 关于 7ART图片
OpenAI

GPT Image 2

最多可包含 16 个参考资料,严格遵循指示并准确处理图片内的文本内容。

分辨率
1K / 2K / 4K
参考文献
最多 16

积分

每张图片 8 / 11 / 20,分辨率分别为 1K / 2K / 4K

查看模型
Z-Image 关于 7ART图片
Alibaba

Z-Image

低成本的文本转图像生成器——完全不需要参考图片。

输出
2K,单一固定画质
参考文献
无 — 仅限文本转图像

积分

每张图片 2 个

查看模型
Grok Imagine (image) 关于 7ART图片
xAI

Grok Imagine (image)

支持文本生成和图像到图像生成;一次固定费用即可生成整批内容。

输出
2K,单一固定画质
参考文献
1
批量
快速模式下生成 6 张图片 · 优质模式下生成 4 张

积分

速度模式下每次生成 4 个 · 质量模式下每次生成 5 个

查看模型
FLUX 关于 7ART图片
Black Forest Labs12 模型

FLUX

FLUX.2 Pro: 注重写实风格和排版设计。

输出
~1 MP
  • FLUX.2 Pro
  • FLUX.2
  • FLUX.2 Turbo
  • FLUX.2 Flash
  • +8 更多

积分 · FLUX.2 Pro

每张图片 6 个

查看模型
Clarity Upscaler 关于 7ART图片

Clarity Upscaler

可对单张图片进行放大处理,默认放大倍数为 2×。

输入
恰好 1 张图片

积分

每次运行 24 次

查看模型
IC-Light v2 关于 7ART图片

IC-Light v2

对单张图像进行重新渲染。

输入
恰好 1 张图片

积分

每次运行 20 个

查看模型
所有 25 图片 引擎,包含各项规格与价格
模型用途规格积分
7Image7ART7ART 的旗舰图像预设——我们的最佳图像质量,被固定在同一选择器顶部。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 16
比基础引擎费率高出 10%
Nano Banana 2Google最多可提供 14 张参考图片——这是确保面部特征一致性的最稳妥选择。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 14
每张图片 16 / 24 / 32,分辨率分别为 1K / 2K / 4K
Nano Banana ProGoogle多图合成。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 8
每张图片 30 / 30 / 60,分辨率分别为 1K / 2K / 4K
Seedream 5 LiteByteDance经济实惠且快捷。
  • 分辨率: 2K / 3K
  • 参考文献: 最多 10
6 张 2K 分辨率图片 · 8 张 3K 分辨率图片
Seedream 4.5ByteDanceSeedream 的中级套餐。
  • 分辨率: 2K / 4K
  • 参考文献: 最多 10
7 张 2K 分辨率图片 · 9 张 4K 分辨率图片
Seedream 4.0ByteDanceSeedreams 的最大分辨率范围。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 10
每张图片 5 / 6 / 8 张,分辨率分别为 1K / 2K / 4K
GPT Image 2.5 FlareOpenAI默认使用 GPT Image 2.5。修改仅限于您要求的内容,主题、构图和背景保持不变。每个等级提供十种宽高比选项。支持透明背景。宽长形状的生成所需积分少于正方形。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 16
每张图片起价 7 积分。16:9 宽屏图片在 1K 分辨率下需 9 积分,2K 分辨率下需 12 积分,4K 分辨率下需 21 积分;正方形图片价格更高,最高可达 36 积分。
GPT Image 2.5 SunburstOpenAIGPT Image 2.5 经过调优,优先保证精度而非速度——适用于需要精确修改的营销活动和产品工作。运行速度慢于 Flare。每个等级提供十种宽高比,支持透明背景。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 16
与 Flare 相同:16:9 宽屏模式下,每张图片消耗 7 积分,1K 分辨率消耗 9 积分,2K 分辨率消耗 12 积分,4K 分辨率消耗 21 积分。
GPT Image 2OpenAI最多可包含 16 个参考资料,严格遵循指示并准确处理图片内的文本内容。1:1渲染无法达到4K分辨率,而未指定尺寸的渲染最高上限为1K。
  • 分辨率: 1K / 2K / 4K
  • 参考文献: 最多 16
每张图片 8 / 11 / 20,分辨率分别为 1K / 2K / 4K
Z-ImageAlibaba低成本的文本转图像生成器——完全不需要参考图片。
  • 输出: 2K,单一固定画质
  • 参考文献: 无 — 仅限文本转图像
每张图片 2 个
Grok Imagine (image)xAI支持文本生成和图像到图像生成;一次固定费用即可生成整批内容。
  • 输出: 2K,单一固定画质
  • 参考文献: 1
  • 批量: 快速模式下生成 6 张图片 · 优质模式下生成 4 张
速度模式下每次生成 4 个 · 质量模式下每次生成 5 个
FLUX.2 ProBlack Forest Labs注重写实风格和排版设计。
  • 输出: ~1 MP
每张图片 6 个
FLUX.2Black Forest Labs写实风格;支持 JSON 和十六进制颜色提示。
  • 输出: ~1 MP
每张图片 3 个
FLUX.2 TurboBlack Forest Labs快速且经济实惠。
  • 输出: ~1 MP
每张图片 2 个
FLUX.2 FlashBlack Forest Labs最快的 FLUX.2。
  • 输出: ~1 MP
每张图片 1 个
FLUX.2 KleinBlack Forest Labs少步 9B 模型。
  • 输出: ~1 MP
每张图片 2 个
FLUX.1 DevBlack Forest Labs经典的 FLUX 品质。
  • 输出: ~1 MP
每张图片 5 个
FLUX.1 SchnellBlack Forest Labs一秒内完成的初稿。
  • 输出: ~1 MP
每张图片 1 个
FLUX.2 EditBlack Forest LabsInstruct-edit — 编辑或组合最多 4 张图片。仅在附加参考图片后才会出现在选择器中。
  • 输出: ~1 MP
  • 参考文献: 最多 4
每张图片 5 个
FLUX.2 Pro EditBlack Forest Labs高级指令编辑。仅在附加参考图片后才会出现在选择器中。
  • 输出: ~1 MP
  • 参考文献: 最多 9
每张图片 9 个
FLUX.2 Klein EditBlack Forest Labs快速、轻量级的编辑。仅在附加参考图片后才会出现在选择器中。
  • 输出: ~1 MP
  • 参考文献: 最多 4
每张图片 5 个
Trained ElementBlack Forest LabsFLUX.1 Dev 加上在您自己的 Element 上训练的 LoRA —— 能够精确复现该身份。仅当提示词中@提及了经过训练的元素时,才会出现在选择器中。
  • 输出: ~1 MP
  • 参考文献: 1
  • 培训: 400 积分,每个元素限用一次
每张图片 10 积分,首次需支付 400 积分用于训练
Clarity Upscaler可对单张图片进行放大处理,默认放大倍数为 2×。仅可通过“超级代理”访问——图像工作室中没有相应的按钮。
  • 输入: 恰好 1 张图片
每次运行 24 次
IC-Light v2对单张图像进行重新渲染。仅可通过“超级代理”访问——图像工作室中没有相应的按钮。
  • 输入: 恰好 1 张图片
每次运行 20 个
FLUX.1 KontextBlack Forest Labs针对单张源图像进行编辑指导。仅可通过“超级代理”访问——图像工作室中没有相应的按钮。
  • 输入: 恰好 1 张图片
每次运行 8 次

03 / 音乐

音乐模型

一家供应商,六个版本,一个统一价格——因为在 7ART 上使用 Suno 的精彩之处,在于作品生成后的所有后续流程。

打开音乐工作室
所有 6 音乐 引擎,包含各项规格与价格
模型用途规格积分
Suno V5.5Suno7ART 音乐工作室中的最新 Suno 版本。
  • 状态: 最新
每次生成 12 个
Suno V5Suno当未选择特定音乐路线时,系统默认生成的版本。
  • 状态: 默认
每次生成 12 个
Suno V4.5 AllSuno早期版本的 Suno,仍可选中。每次生成 12 个
Suno V4.5+Suno早期版本的 Suno,仍可选。每次生成 12 个
Suno V4.5Suno早期版本的 Suno,仍可选中。每次生成 12 个
Suno V4Suno工作室中仍可选择的最早版本的 Suno。每次生成 12 个

04 / 语音与音频

语音和音频模型

语音、对话、音效和配乐。ElevenLabs 引擎通过 fal 运行,并采用 kie 作为备用方案;Sonilo 仅有一个提供商,且无第二阶段。

打开语音工作室
所有 11 语音与音频 引擎,包含各项规格与价格
模型用途规格积分
ElevenLabs Turbo 2.5ElevenLabs快速文本转语音套餐。
  • 速度: 0.7×–1.2×
每 1,000 个字符 10 个
ElevenLabs Multilingual v2ElevenLabs多语言文本转语音服务层。
  • 速度: 0.7×–1.2×
每 1,000 个字符 20
ElevenLabs Eleven v3ElevenLabs富有表现力的文本转语音层级。
  • 速度: 0.7×–1.2×
每 1,000 个字符 20
ElevenLabs v3 DialogueElevenLabs来自剧本的多角色对话。每 1,000 个字符 20
ElevenLabs Sound Effects v2ElevenLabs来自文本描述的声音效果。每秒 0.4
ElevenLabs Audio IsolationElevenLabs去除录音中的背景噪音。每秒 0.34
ElevenLabs Speech-to-TextElevenLabs将音频文件中的语音转录为文字。每分钟 6 次
ElevenLabs DubbingElevenLabs将视频配音为另一种语言。每分钟 180 个,向上取整
HeyGen Video Translate — PrecisionHeyGen通过克隆声音和重新同步嘴型来翻译视频。每秒输出 20 项
HeyGen Video Translate — SpeedHeyGen快速视频翻译模式。每秒 10 个输出
Sonilo v1.1Sonilo与动作相呼应的音效设计——与视频同步的拟音或配乐,或根据文字描述生成的其中一种。
  • 模式: 视频 → 音效 · 视频 → 音乐 · 文本 → 声音 · 文本 → 音乐
  • 章节: 每条≥5秒,连续播放,≤200个字符
  • 最低消费额度: 时长不少于 15 秒
视频模式下均为 1.8/秒 · 文本转声音为 0.36/秒 · 文本转音乐为 0.5/秒,且最低时长为 15 秒

05 / 虚拟形象与口型同步

虚拟形象和唇形同步模型

来自四家供应商的四款引擎,可让面部动起来,无论是基于单张肖像还是您已有的视频素材。

打开唇形同步工作室
所有 5 虚拟形象与口型同步 引擎,包含各项规格与价格
模型用途规格积分
Kling Avatar — StandardKling AI将人像转化为会说话的虚拟形象。
  • 质量: 720p
  • 最大长度: 60s
每秒 8 个
Kling Avatar — ProKling AI1080p 会说话的虚拟形象套餐,以及工作室中最长的视频片段。
  • 质量: 1080p
  • 最大长度: 5分钟
每秒 16 个
HeyGen Avatar IVHeyGen将照片转化为会说话的虚拟形象。
  • 质量: 720p / 1080p
  • 最大长度: 60s
每秒 20 次
Omnihuman 1.5ByteDance将人像转化为会说话的视频。
  • 质量: 720p / 1080p,收费标准相同
  • 最大长度: 60s
每秒 27 次
Volcengine Lip SyncVolcengine将现有视频与新音频进行重新口型同步。
  • 输入: 源视频
  • 最大长度: 60s
每秒 8 个

06 / 3D

3D模型

四个生成器和两个网格工具,均通过 fal 实现。Polycount 数值代表工作室滑块的调节范围,该范围特意设置得比端点可接受的范围更窄。

打开 3D 工作室
所有 6 3d 引擎,包含各项规格与价格
模型用途规格积分
Meshy 6Meshy最出色的全能网格——四边形拓扑、PBR材质和姿势。
  • 模式: 图片 · 多视角 · 文本
  • Polycount: 10,000–300,000
  • 补充说明: PBR · 四边形拓扑 · A 姿势 / T 姿势
  • 图片: 最多 4
每次生成 240
Hunyuan 3.1 Pro最高精度的网格,支持多视图输入。
  • 模式: 图片 · 多视图 · 文本
  • Polycount: 40,000–1,500,000
  • 补充说明: PBR
  • 图片: 最多 4
每次生成 80 个
Trellis 2仅需一张图片,即可快速生成且价格实惠。
  • 模式: 仅限图片
  • Polycount: 10,000–300,000
  • 图片: 1
每次生成 60 个
Tripo 2.5Tripo3D3D工作室中最快的网格。
  • 模式: 图片 · 多视角 · 文本
  • Polycount: 10,000–300,000
  • 补充说明: PBR
  • 图片: 最多 4
每次生成 60 个
Retexture EngineMeshy根据提示或风格参考图,为现有的网格模型重新生成纹理。
  • 输入: 现有网格 + 1 张风格化图像
  • 补充说明: PBR
每次运行 60 次
RemeshMeshy对模型进行重新网格划分、重新缩放和重新导出,以便进行打印或进入其他处理流程。
  • 输入: 一个现有的网格
  • Polycount: 10,000–300,000
  • 格式: GLB · FBX · OBJ · STL · USDZ
每次运行 40 个

模型如何出现在此页面上

只有在能够实际运行模型时——即获得 API 访问权限、编写好适配器并设定好价格后——该模型才会在此出现。访问权限由供应商授予,而非由我们承诺,因此您不会在此页面上看到任何我们目前无法生成的内容的发布日期。

您将获得一个集中管理所有功能的平台。统一的提示栏、统一的参考素材上传功能、统一的素材库,以及所有模型共享的信用余额——因此,从生成图片到视频再到乐谱,您只需通过下拉菜单切换,无需重新订阅。

当两个服务商提供相同的模型时,我们会将其中一个设为主模型,另一个设为备用模型,无论使用哪一个,您看到的价格都是一样的。

上述所有模型,仅需一次余额

无需按供应商订阅,无需单独账户,也无需在新模型发布时每次重新学习界面操作。