每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Pika, 音频模型4款公开发布…仅限API使用

分别负责配乐、音乐、音效、语音的四款模型,以价格为卖点率先在Pika API Club公开

이미지: X — 미디어·생성AI

摘要

  • Pika宣布公开Pika Soundtrack、Music、SFX、Speech四款音频模型,并表示仅在Pika API Club提供
  • Pika宣称比市场上所有音频模型都便宜,最多便宜20倍,公开的具体数字只有Soundtrack每秒0.617美元这一项
  • Pika将Hunyuan Foley列为在为视频生成声音方式上具有可比性的模型,并表示自家Soundtrack的成本效率是其2倍
原文视频
발표
Pika, 2026년 8월 14일 X 게시
모델 수
4개 — Pika Soundtrack, Pika Music, Pika SFX, Pika Speech
제공 경로
Pika API Club 전용
가격 주장
시장의 모든 오디오 모델보다 저렴, 최대 20배
Soundtrack 단가
초당 0.617 (원문 표기 0.617 / seconds)
비교 모델
Hunyuan Foley 대비 비용 효율 2배, Pika는 이 모델을 비교 가능한 유일한 video-to-audio 모델로 지목
저가 근거
Pika는 학습·추론 효율 개선을 이유로 들었다
예고
Pika는 생성 미디어 접근성을 높이는 후속 발표를 예고했다

为视频配声音,长期以来是由人工把控的领域。像脚步声、关门声这样需要精确对准画面时间点的拟音(foley)工作,必须精确到秒。Pika于8月14日公开的四款音频模型,提出了将整个拟音工作转变为API调用的方案。而Pika在此次发布中最先强调的,不是性能,而是价格。

이미지: X — 미디어·생성AI

拆分成四款的声音

Pika表示,此次推出了覆盖生成声音全领域的4款前沿基础模型。从名称就能看出各自的分工。Soundtrack负责匹配视频的声音,Music负责音乐,SFX负责音效,Speech负责语音。并非合并为一个万能模型,而是按用途拆分的结构。

模型负责领域公开数据
Pika Soundtrack匹配视频的声音(video-to-audio)每秒0.617美元 · 成本效率为Hunyuan Foley的2倍
Pika Music音乐生成
Pika SFX音效生成
Pika Speech语音生成

四款模型中,只有Soundtrack附有具体数字。Pika标注为每秒0.617,但帖子中未标明货币单位。Pika指出,在输入视频生成声音的方式上,唯一可比的模型是Hunyuan Foley,并宣称自家Soundtrack的成本效率是其2倍。Hunyuan是腾讯打造的模型系列。

以价格为标题的发布

Pika表示,已将价格做到比市场上所有音频模型都便宜,最多便宜20倍。通常此类语句后面会附带条件说明的脚注。但Pika打了星号,写道"真的没有任何免责声明"(Pika, X)。虽是带点玩笑的表述,但也是一种不设条件、直接给出数字的自我宣示。

价格降低的原因,Pika归结为团队在训练与推理效率上的改进。推理(inference)——即已训练完成的模型实际生成结果的阶段——其成本,在音频这类按时长计费的模态中,会直接反映为单价。

如何试用

**从哪里开始。**入口只有一个,即Pika API Club。Pika明确表示,四款模型仅能在此使用。API是程序之间相互调用的接口,所谓"以API形式公开",意味着其他应用或编辑工具可以直接调用该模型。也就是说,此次发布并非面向普通用户在网页上点击按钮使用的形式,而是首先面向开发者和制作流程。

使用步骤。

  1. 登录Pika API Club获取API使用资格。此处可用模型列表中会同时显示四款音频模型。
  2. 根据要制作的声音类型选择模型。匹配视频的声音选Soundtrack,背景音乐选Music,单独效果音选SFX,台词、旁白选Speech。
  3. Soundtrack以视频为输入,生成匹配该画面的声音。计费按输出结果时长(秒)计算,测试时建议先输入较短片段较为稳妥。
  4. 将生成的音轨叠加到编辑时间线上,仅对与画面不符的区段重新调用。

**可以尝试的用途。**例如,将自行拍摄的30秒产品视频输入Soundtrack,可一次性获得手触碰包装盒的声音及周围环境音。若是短广告,可用Music单独生成背景音轨,用Speech单独生成旁白后再叠加。对于像游戏原型这类需要数百个效果音的工作,反复调用SFX来填充列表,更符合按秒计价的结构。

为何价格被放在最前面

今年生成式AI发布中,价格表占据头条的情况并不少见。8月12日公开的Grok 4.6价格为每百万token输入2美元、输出6美元,低于Claude Opus 5(5美元/25美元)和GPT-5.6 Sol(5美元/30美元)。同一天,DeepSeek推出了DeepSeek-V4-Pro-0813的正式收费标准,缓存未命中的输入为0.435美元、输出为0.87美元。这股此前发生在语言模型领域的趋势,如今延伸到了音频领域。

音频的计费单位与语言模型不同,计的不是token,而是秒。因此,在诸如一部5分钟视频、一款游戏中数百个效果音这类需要大量素材堆积的工作中,单价差异会直接改变可制作的范围。

由此带来了什么变化

眼下最先受到影响的,是那些自行搭建视频制作流程的团队。此前已经实现视频生成自动化、却仍需借助另外的工具和另外的付费方式来添加声音的团队,如今可以在同一个API入口内,一次性调用配乐、音乐、音效、语音。对于开发编辑工具或视频服务的开发者来说,也多了一个在自家产品上添加声音生成功能的选项。

Pika表示,此次的音频模型系列只是其在幕后准备内容之一,并预告将持续推出让更多人能够使用生成式媒体的方式。四款模型的实际质量,最终还是要靠在同一段视频上并排运行不同模型的结果来判断。除了每秒单价之外,画面与声音是否错开了几帧,在拟音工作中往往比价格更先引起人们的注意。