All models

tts-1-hd

OpenAIAudio
267.81 Credits
Get your API key
tts-1-hd

面向成品旁白与内容朗读的高质量语音模型

tts-1-hd 是 OpenAI 的质量优先型文本转语音模型,适合把已经写好的讲解稿、课程文案和产品介绍转换为可播放音频。它与侧重实时使用的 tts-1 分工不同,更适合重视成品听感的制作流程。通过预设声音、音频格式与语速选择,可将文字内容接入配音、朗读和应用播报环节。

OpenAI模型品牌
音频模型类型
音频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
文本转语音,输入字符串,输出二进制音频
模型定位
质量优先;同系列 tts-1 侧重实时使用
预设声音
alloy、echo、fable、onyx、nova、shimmer
默认声音
alloy
音频格式
mp3、opus、aac、flac、wav、pcm;默认 mp3
语速控制
speed 数值参数,默认 1.0
调用入口
POST /v1/audio/speech;model 为 tts-1-hd

质量优先是 tts-1-hd 的原生定位;本平台通过 POST /v1/audio/speech 提供调用,支持上述预设声音、音频格式和语速参数。

核心能力

了解 tts-1-hd 能为你的工作带来什么。

围绕成品听感选型

tts-1-hd 的核心取舍是优先语音质量,而不是以实时交互为首要目标。对于已经定稿、需要试听后发布的旁白,可以把它放在文字审校之后、音频剪辑之前使用,让内容团队围绕声音效果完成选型,而不必把语音生成与文案创作混在同一步。

预设声音便于统一制作

模型提供 alloy、echo、fable、onyx、nova、shimmer 六种预设声音。制作时可先用同一段代表性文稿试听,再为课程或内容栏目固定一种声音。voice 用于选择预设音色,适合建立统一的朗读配置,不等同于上传真人录音复刻声音。

格式与语速配合交付

音频可以按播放或制作环节选择 mp3、opus、aac、flac、wav 或 pcm,默认使用 mp3;speed 则提供语速调整入口。需要网页播放、移动端播报或后期剪辑时,可分别规划文件格式与朗读节奏,接收结果时按音频二进制处理。

适用场景

从具体任务出发,找到模型发挥作用的位置。

课程与知识讲解

将审校完成的课程讲稿、概念解释或操作说明作为文本输入,选择固定声音生成讲解音频。建议按章节组织文稿,试听术语、数字和段落衔接,再将合格片段用于课件或学习页面,形成可随内容更新而重新制作的语音素材。

产品视频旁白

输入产品介绍、功能演示解说或宣传视频旁白,先比较预设声音与画面风格,再选择格式供剪辑使用。交付物是所输入文稿的语音音频;背景音乐、音效、字幕和画面同步应放在后期制作流程中处理,避免把配音请求当成完整视频制作。

文章朗读与应用播报

把编辑好的文章段落、帮助说明或应用提示转换为音频,供读者点播或在界面中播放。对于可提前制作的固定内容,可先生成并完成试听,再随页面发布;需要现场回答的应用,则应把答案生成与答案朗读拆成不同任务。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

成品配音优先考虑 HD

如果任务是制作可反复播放的课程、文章朗读或视频旁白,tts-1-hd 的质量优先定位更符合选型目标。与 tts-1 比较时,重点应放在代表性文稿的听感和制作流程,而不是仅凭 HD 名称推断采样率、声道或输出时长;正式制作前先用实际内容试听。

实时交互与转录另作选择

若核心需求是实时语音反馈,tts-1 的原生定位更贴近这一方向,但实际交互体验仍需结合应用测试。若需求是把已有录音变成文字,则应选择音频转录模型。tts-1-hd 负责把文本读出来,不替代语音识别,也不负责生成对话答案或执行应用操作。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • tts-1-hd 的基本输入是待朗读文本,声音选择来自预设列表。不要把 voice 当作真人身份、参考录音或声音克隆指令;若项目必须复刻指定人物的音色,应另选明确支持该创作方式的语音方案。
  • 质量优先不等于对所有文稿自动完成专业播音审校。专有名词、缩写、数字与复杂标点应在发布前试听;需要调整时,优先修改文本表达、分段方式或语速,再重新生成对应片段。
  • 输出是语音音频,不是附带字幕、逐词时间轴和背景音乐的完整节目。长内容宜按制作单元管理,并在应用中处理保存、播放与拼接;不要仅凭 HD 名称预设固定音频时长或特定编码参数。

常见问题

解答使用 tts-1-hd 时的常见疑问。

tts-1-hd 与 tts-1 应该怎样选?

tts-1-hd 侧重质量,tts-1 侧重实时使用。课程配音、文章朗读和需要审听后发布的旁白可优先试用 HD;实时反馈则应重点评估 tts-1。建议使用同一段实际文稿比较,而不是把型号差别理解为固定的速度或音质倍数。

如何选择 tts-1-hd 的声音?

通过 voice 选择 alloy、echo、fable、onyx、nova 或 shimmer,默认是 alloy。可用包含术语、数字和普通叙述的短稿逐一试听,再确定适合内容的声音。选定后,在同一栏目中保持相同配置,有利于统一音频制作风格。

tts-1-hd 能使用自己的录音定制声音吗?

这里的创作方式是输入文本并选择预设声音,不应按参考录音定制声音的流程使用。voice 填写的是声音名称,而非文件地址或人物描述。需要声音克隆时,应选择明确支持参考音频的产品,并单独处理授权与制作要求。

生成的音频能用于播放和剪辑吗?

可以根据用途选择 mp3、opus、aac、flac、wav 或 pcm,默认输出格式为 mp3。调用后应按二进制音频保存或交给播放器,而不是当作文本回答解析。用于剪辑时,还需在制作软件中安排画面同步、背景音乐及最终导出。

怎样提交文稿并调整朗读速度?

向 POST /v1/audio/speech 提交 input 文本,model 使用 tts-1-hd,并按需设置 voice、response_format 和 speed;speed 默认值为 1.0。实际制作可先用短稿试听语速,再处理正文,文本中也应保留合理标点和段落边界。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 tts-1-hd 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。