AI 见闻
精选· 重要性 4/5

100美元AI音乐视频对决:Claude Fable 5 vs GPT-5.6 Sol

Hacker News (AI)··hershyb_·约 8 分钟阅读
社区热度 391
中文导读

本文对比了Claude Fable 5和GPT-5.6 Sol在自主制作音乐视频任务中的表现,揭示了前沿模型在工具使用、创意执行和成本控制方面的能力与局限。

100美元AI音乐视频:Claude Fable 5 vs GPT-5.6 Sol我们给Claude Fable 5和GPT-5.6 Sol相同的歌曲、预算、网络搜索和本地ffmpeg,然后让每个模型自主导演一部音乐视频。

我们构建了一个小型智能体框架,任务只有一个:给模型一首歌、一个硬性美元预算和一套工具,然后放手让它自己制作完整的音乐视频。模型会研究有哪些视频模型可用、生成片段、观看自己的素材、用ffmpeg剪辑,并组装出最终成片。

我们上次构建的一些读者表示,他们想看看模型之间工具使用的实际差异,因此我们给前沿级模型一个开放式、长周期的任务,让每个模型自己决定研究什么、生成什么以及如何剪辑。我们记录每一次工具调用,这样你可以精确看到每个模型的工作方式(完整记录见下文)。

我们运行了两个模型:Claude Fable 5和GPT-5.6 Sol,每个模型有两种预算(25美元和100美元),共四次运行。

每次运行使用相同的歌曲(Bruno Mars和Mark Ronson的"Uptown Funk")、一段简短的文字描述和一份带时间戳的歌词文本。设置每个模型运行一个自主工具调用循环,包含六个工具:- plan:用于思考的工具(无成本,无行动)。

- web_search:用于研究生成模型及其API,并获取音乐视频相关信息(如果需要)。- get_budget:检查剩余预算。- generate_image和generate_video:唯一消耗预算的工具。

模型可以选择任何FAL或Replicate模型,并传递自己的参数。- run_command:一个本地shell,可使用ffmpeg/ffprobe,用于分析音频、剪切和拼接片段,以及混流最终视频。

一旦预算归零,付费生成将被拒绝,但模型可以继续剪辑。每个模型消息、工具调用、费用和错误都被记录下来。整个框架在github.com/hershalb/music-video-arena开源,因此你可以自己运行。

四个视频下面的每个片段都是模型最终自行组装的输出,mp4格式,全长并混入了原曲。数据所有四次运行都自行完成(没有达到步骤或时间限制),并且都生成了一个有效、全长的视频,混入了原曲。“生成花费”是计量的FAL成本,即预算上限。

在25美元预算下,两个模型几乎都花光了。在100美元预算下,它们花费了36.57美元(Sol)和48.60美元(Fable),因此更多预算确实转化为了更多素材。这不包括运行模型本身的成本,我们在下面添加了该成本。

完成视频的时间每个模型使用的工具在自行选择工具时,模型出现了分歧。四次运行中有三次采用纯文本到视频的方式。只有GPT-5.6 Sol在25美元预算下使用了图像到视频的流程(先生成静态图像,然后将其动画化)。

GPT-5.6 Sol在100美元预算下在一次运行中混合使用了三种不同的视频模型。价格是FAL的标价,除非另有说明,否则按每秒输出视频显示。Hailuo 2.

3 Standard按每个视频定价(约每6秒片段0.28美元),而Seedance 1.0 Pro按token计费(每5秒1080p片段约0.62美元,上图显示为其每秒有效费率)。每次运行生成的不同片段数量从46到80不等。

工具使用每次运行的工具调用次数(这包括尝试次数,包括失败的生成调用)。每次运行的完整记录,包括每个计划、工具调用和命令,都在这里:Fable 5 · $25, Sol · $25, Sol · $100, Fable 5 · $100。

过程中的错误“失败调用”是指返回错误的生成请求(主要是提供商的临时网络故障)。这些请求不会被收费,但模型会花费步骤重试它们。Token使用每次运行的总成本预算仅计量生成(FAL)花费。

加上Claude Fable 5(每100万输入/输出token $10/$50)和GPT-5.6 Sol($5/$30)的LLM token成本,得到每次运行的总成本。

对于Claude Fable 5,仅token就花费了16.99到25.05美元,约占每次运行总成本的30-40%。GPT-5.6 Sol的token成本尽管token量相似,但保持在3-4美元左右。

方法说明- 所有四次运行的输入相同:歌曲、一段简短的文字描述和一份带时间戳的歌词文本。每个模型在FAL上选择自己的生成模型,并进行自己的ffmpeg剪辑。- 挂钟时间包括模型自身的重试以及等待提供商队列的时间。

- 生成花费是基于每个模型价格表的最佳估算。自己试试该竞技场是开源的:github.com/hershalb/music-video-arena。

指向你自己的歌曲和预算,换成任何你想互相对比的模型,看看它们会制作出什么。欢迎提交问题和PR,我们很乐意收到关于该设置的反馈。我们的看法这些音乐视频没有一个很出色,但观察模型如何达到这一结果非常有趣,并且确实显示了前沿模型仍然明显存在的差距。

几点说明:- 角色和故事的一致性对所有四个模型来说都是一项挑战。反复出现的角色在镜头之间漂移,没有一个视频从头到尾保持连贯的故事情节。- 模型非常字面地理解歌词。“让一条龙想退休,伙计”会在屏幕上生成一条真实的龙。

几个镜头很有趣,但过了一段时间就有点奇怪了。- 节奏匹配很弱。剪辑落在节拍上(它们都运行了ffmpeg节拍检测),但片段内的运动、舞蹈、镜头移动很少与歌曲的节奏匹配,因此常常感觉有点不对劲。例如,歌词“我得亲亲自己,我太漂亮了”显示主角做出亲吻动作的速度太慢。

- GPT-5.6 Sol在25美元预算下是最有创意的剪辑者。它用视频效果叠加了文字和动画静态图像,这是其他运行都没有尝试过的技术。其余运行大多只是将生成的片段拼接在一起。GPT-5.6 Sol在100美元预算下还尝试了多种视频模型,而不是像Fable那样只坚持使用一种。

- 没有人真正迭代剪辑。

一旦片段存在,模型就进行拼接和混流,但很少回去重新剪辑或添加效果,也没有人认真检查自己的片段以确认它们是否足够好。GPT-5.6 Sol的100美元运行输出了一些真正低质量的AI片段,而Claude Fable 5恰好选择了一个输出更连贯的模型。

其中一些可能是模型限制,但缺乏自我审查值得注意。- 两个模型都没有碰Replicate。FAL和Replicate的密钥都可用,但所有四次运行都只使用了FAL。- Claude Fable 5是更昂贵的选择。

它每次运行的成本更高(总体最高,为73.65美元),尽管完成速度比GPT-5.6 Sol快。主观上,我们稍微偏好Fable的100美元视频,尽管没有一个让我们惊艳。- 100美元预算可能太多了。

两个模型都不愿花到接近上限,并且都保持了适中的步骤数。有了这个空间,它们本可以例如预先生成一致的角色图像并从中制作动画,但两者都没有选择这样做。我们将观察模型在更主观/风格化的任务上是否能随着它们变得更智能而改进,但就目前而言,仍有很大的改进空间。

自己试试这里提到的每个模型都可以在TryAI上用一个账户使用,按需付费,无需订阅。免费开始

原文出处
$100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读