Pilot 派诺信息星模XModel
首页模型榜单价格工具文档博客
登录 / 注册
模型

模型加载中

正在打开模型详情…

Pilot 派诺信息星模XModel

星模XModel:一个 OpenAI 兼容端点接入主流大模型,按量计费,支持 BYOK 与团队预算管理。

产品

模型市场榜单价格

工具

成本计算器迁移检测价格对比账单分析凭证验证

接入文档

快速开始OpenAI 迁移计费

法务

隐私政策服务条款退款政策

参考资源

低价 LLM APIOpenRouter 替代方案
© 2026 星模XModel主办单位:贵州派诺数海观澜数字产业发展有限公司黔ICP备2026008986号-2
Qwen Audio 3.0 TTS Flash API 价格、能力、上下文与 OpenAI 兼容代码 · 星模XModel
Alibaba Cloud / Qwen 模型

Qwen Audio 3.0 TTS Flash

Qwen Audio 3.0 TTS Flash 是来自 Alibaba Cloud / Qwen 的文本转语音模型。当前页面展示按万字符价格,可通过 `/v1/audio/speech` 调用。

阅读快速开始→成本估算
Alibaba Cloud / Qwen提供方公开定价生产可用
价格
¥1 / 万字
可用性
生产可用
模型代码模型介绍模型能力星模结算价免费额度模型限流与上下文API 代码示例请求参数调用契约与音色

模型代码

模型能力与计费维度与提供方保持一致,对外统一使用 OpenAI 兼容地址和模型代码。

模型代码
qwen-audio-3.0-tts-flash
网关地址
https://modelxing.com/v1
接口兼容
OpenAI 兼容语音合成接口
阅读快速开始

模型介绍

Qwen Audio 3.0 TTS Flash 是来自 Alibaba Cloud / Qwen 的文本转语音模型。当前页面展示按万字符价格,可通过 `/v1/audio/speech` 调用。

  • 已提供人民币计价的公开按万字符价格。
  • 已进入公开模型市场,可用于横向对比。
  • 可通过 `/v1/audio/speech` 调用。

模型能力

语音合成 / 语音智能体 / 语音回复

输入模态
文本
输出模态
文本

模型指标

可用性
生产可用
路由状态
已配置
延迟估算
900-4200ms

常见问题

Qwen Audio 3.0 TTS Flash API 问题

Qwen Audio 3.0 TTS Flash 在星模XModel 中如何计费?

星模XModel 以公开价格展示 Qwen Audio 3.0 TTS Flash(按万字符),便于对比和预算规划。

如何调用 Qwen Audio 3.0 TTS Flash?

这个模型系列可使用 `/v1/audio/speech` 调用。

支持参数
流式输出

星模结算价

该模型按用量单位计费(如每秒、每张),以下为各规格档的结算价。

语音合成
¥1 / 万字
上游公开价格参考

仅供参考,不作为星模结算依据。

来源: 上游公开页面(平台采集) · 采集时间: 2026-09-04T16:55:38.195Z
  • 语音合成 · per_10k_chars: ¥1

免费额度

当前页面不承诺额外免费额度;实际赠送、活动和用量抵扣以控制台账户状态和正式账单为准。

免费额度
暂无免费额度信息

模型限流与上下文

默认按账户、模型和上游可用性动态调度。生产接入前建议先用小流量压测确认并发、延迟和错误率。

限流说明
已配置
延迟估算
900-4200ms

API 代码示例

复制以下示例,替换网关地址与 API Key后即可直接调用。

Python
import time
import requests

resp = requests.post(
    "https://modelxing.com/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    json={"model": "qwen-audio-3.0-tts-flash", "voice": "Cherry", "input": "Hello from XModel", "response_format": "wav"},
)

if resp.status_code == 200:
    # Short text — audio returned directly
    with open("output.wav", "wb") as f:
        f.write(resp.content)
else:
    # Long text — job submitted (202), poll until done
    job_id = resp.json()["id"]
    while True:
        poll = requests.get(
            f"https://modelxing.com/v1/audio/speech/jobs/{job_id}",
            headers={"Authorization": "Bearer YOUR_API_KEY"},
        ).json()
        if poll["status"] == "succeeded":
            print("Audio ready:", poll["audio"]["url"])
            break
        elif poll["status"] == "failed":
            print("Job failed:", poll["error"])
            break
        time.sleep(3)

请求参数

该模型所属接口类型支持的请求参数参考。具体可用取值以上游模型能力为准。

参数类型 / 必填默认 / 可选值说明
model
string
是
默认—
可选值—
要调用的模型 id。
input
string
是
默认—
可选值—
要合成为语音的文本。
voice
string
是
默认—
可选值—
使用的音色 id。
response_format
string
否
默认mp3
可选值mp3 | wav | pcm
音频封装格式。
speed
number
否
默认1
可选值—
语速倍率,0.5–2。

model

是
类型
string
默认
—
可选值
—

要调用的模型 id。

input

是
类型
string
默认
—
可选值
—

要合成为语音的文本。

voice

是
类型
string
默认
—
可选值
—

使用的音色 id。

response_format

否
类型
string
默认
mp3
可选值
mp3 | wav | pcm

音频封装格式。

speed

否
类型
number
默认
1
可选值
—

语速倍率,0.5–2。

调用契约与音色

以下音色列表整理自官方文档,供选择参考;音色以上游最终校验为准,完整机器可读契约可经 GET /v1/models/{id} 获取。

调用端点
/v1/audio/speech
默认音色(不带 voice 时)
longanhuan_v3.6
音频格式
wav、pcm、mp3
兼容音色名
chelsie → longanhuan_v3.6;cherry → longanhuan_v3.6;ethan → longanhuan_v3.6;serena → longanhuan_v3.6
复刻基础音色
qwen-audio-3.0-tts-flash-<suffix>
音色来源
阿里云官方音色文档
  • 另有 500+ 声音复刻基础音色,voice 形如 qwen-audio-3.0-tts-flash-<suffix>,见官方基础音色列表。
  • 兼容名 Cherry/Serena/Ethan/Chelsie(大小写不敏感)由网关映射为 longanhuan_v3.6 后再上游。
  • 音色不在支持列表时上游返回 InvalidParameter(Engine error 411)。

音色列表

voice音色名描述支持语种
longanfengyue龙安风悦自然亲切音中文(普通话)、英文
longanyuanfei龙安元妃高傲妃子音中文(普通话)、英文
longanlingxi龙安灵希可爱甜美音中文(普通话)、英文
longanxiaoxin龙安小昕亲切活泼音中文(普通话)、英文
longanhuan_v3.6默认龙安欢中文(普通话)、英文
longjielidou_v3.6龙杰力豆天真男童中文(普通话)、英文
longpaopao_v3.6龙泡泡软糯可爱音中文(普通话)、英文
longhuohuo_v3.6龙火火顽皮少年音中文(普通话)、英文
longchuanshu_v3.6龙川叔川普大叔音中文(普通话)、英文
loongmaryloongmary温暖英音英文
loongeva_v3.6loongeva高智美音英文
loongjohnloongJohn沉稳亲切美音英文

可替代模型

Alibaba Cloud / Qwen生产可用

Fun ASR Flash (2026-06-15)

Fun ASR Flash (2026-06-15) 是来自 Alibaba Cloud / Qwen 的文本对话模型。当前页面展示按秒价格,可通过 `/v1/audio/transcriptions` 调用。

¥0.0002 / 每秒价格—上下文每秒计费
JSON 模式
查看详情
Alibaba Cloud / Qwen生产可用

Fun ASR Flash 8k实时语音识别

Fun ASR Flash 8k实时语音识别 是来自 Alibaba Cloud / Qwen 的实时语音识别模型。当前页面展示按秒价格,可通过 `/v1/realtime` 调用。

¥0.0002 / 每秒价格—上下文每秒计费
流式输出
查看详情
Alibaba Cloud / Qwen生产可用

Fun ASR Flash 8k实时语音识别 (2026-01-28)

Fun ASR Flash 8k实时语音识别 (2026-01-28) 是来自 Alibaba Cloud / Qwen 的实时语音识别模型。当前页面展示按秒价格,可通过 `/v1/realtime` 调用。

¥0.0002 / 每秒价格—上下文每秒计费
流式输出
查看详情