Appearance
网上玩玩梗就得了,你真以为豆包很弱?
网上有一种论调。
豆包嘛,玩具。
真干活儿,还得看国外御三家。
Claude 写代码。GPT 搞推理。Gemini 看视频。
豆包?就陪聊的水平。
我跟你说,这个认知,落后至少半年了。

先承认一件事。
Claude 确实强。但跟你有关系吗?
逻辑推理、复杂编码、长文分析——Claude 在这些领域的领先,我不否认。
我自己也用 Claude。深度思考一开,拆解一个复杂的投放模型,推演三条路径的 ROI 走向,Claude 出来的东西确实有层次。
但有个问题。
Claude 对中文用户,极其不友好。
发一段中文过去,它回你一段半英半中的东西。语气端着,像外企高管在给你做季度汇报。
更致命的是——Claude 没有多模态理解能力。
你不能给它看视频。不能让它分析一张带货素材截图。不能让它反推竞品镜头的运镜逻辑。
但这些,才是一个电商人、一个自媒体人每天真正要做的事。
你让 Claude 反推一条带货视频?
它连视频文件都收不了。
发一张截图过去,它能分析构图、色调、人物表情。但运镜呢?前3秒弹瓶盖那个动作呢?两个镜头之间的硬切节奏呢?
全瞎了。
还不止这个。Claude 写的中文脚本,永远一种味。"该产品采用..."、"值得一提的是..."、"综上所述..."
你看过哪个带货主播喊"综上所述"的?
中文互联网的真实语气——口播里的语气词、夫妻档的互怼节奏、镜头前的"姐妹你看"——Claude 完全抓不到。它就是一个英文模型被强行要求说中文,说出来的东西像外交部发言人念稿。
写代码的需求,占比有多小?
网上那群测评博主,测模型永远跑 LeetCode、跑 HumanEval、跑 SWE-bench。
刷分嘛,好看。
但你冷静想想——你身边有几个做电商的,每天需要模型写 Python?
我做了 14 年电商,操盘过 7 个品类。
我每天用 AI 干嘛?
- 反推竞品视频。一条爆款,镜头怎么切的、产品怎么入镜的、材质是哪一种——拆清楚。
- 写带货脚本。拿到反推结果,改成自己的品类的脚本。
- 仿写口播文案。竞品"洗脸皂狗都不用",我改成"夏凉被闷得要死"。
- 写即梦提示词。把分镜描述变成即梦 Seedance 能直接粘贴的中文提示词。
哪个需要写代码?
一个都没有。
实测一:反推竞品视频——谁看出了"沉浸式"?
拿一条真实带货视频。
枕头。31 秒。竖屏。两个男生。
这条视频有个特点——它是沉浸式的。
什么是沉浸式?全程固定机位。不切镜。不换场景。没有"主播对着镜头讲、再切产品特写"的套路。
两个人坐在桌前,面前一堆枕头。从头到尾,他们用手演示:按压→躺下→倒水→倒黄水→倒茶水→擦掉→打气测透气。31 秒,一气呵成。
观众感觉不是在看广告,是在看两个人现场测试。这就是沉浸式的威力——把你的产品演示过程变成一场"微型真人秀",卖点在动作中自然流露,不用喊。
但这个风格,AI 能识别出来吗?
我把这条视频分别喂给 Seed 2.1 Pro 和 Gemini 3.1 Pro。同一个 prompt。
Prompt 里没有提"沉浸式"三个字。我只要求了七项输出:元数据、材质、逐镜拆解、脚本、镜头分析、即梦提示词、脚本框架。
就看模型自己能不能悟出来。
结果:
两个模型收到的 prompt 完全相同: "你是短视频带货视频反推专家。输出:一、元数据 二、产品材质 三、逐镜拆解 四、脚本全文 五、镜头分析 六、即梦分镜提示词 七、脚本框架"

| Seed 2.1 Pro | Gemini 3.1 Pro | |
|---|---|---|
| 耗时 | 39.6 秒 | 29.2 秒 |
| 镜头数 | 9 镜逐镜拆解 | 4 镜合并大段 |
| 输出字数 | 2,705 | 1,013 |
| 即梦提示词 | 9 个中文分镜 | 0 个 |
| 脚本框架 | 6 段完整拆解 | 无 |
差距不在速度上。39 秒对 29 秒,谁也不差那 10 秒。
看实际输出。
Gemini 3.1 Pro 的"逐镜拆解"——四个大段:
0:00-0:05 | 中景 | 两人站枕头堆后,一人头砸向枕头
0:05-0:20 | 中景 | 两人依次倒透明、黄色、棕色液体在枕头上,用纸巾一秒擦净
0:20-0:27 | 中景 | 一人举枕头,另一人隔枕头打气,水杯冒泡
0:27-0:31 | 中景 | 两人抱枕头后仰定格四个镜。倒清水、倒黄水、倒茶水——三个不同卖点,它揉成一个"倒液体"。透气测试描述成了"隔枕头打气,水杯冒泡"——原视频用的是气囊装置,根本不是打气。
产品材质:Gemini 写"白色长方形枕头(防水防污面料,带红色 Logo 标签)"。没了。Seed 写"白色纯棉/聚酯纤维面料,红色品牌标识,边缘缝制红色标签与白色洗水标"。连洗水标都看到了。
Seed 2.1 Pro 的输出——九镜表格,每一镜:
镜4 | 7-10秒 | 中景 | 固定 | 右侧男生将清水倒在枕芯表面,模拟流口水场景 | 台词:流口水
镜5 | 10-15秒 | 中景 | 固定 | 左侧男生倒黄色液体、右侧男生倒茶色液体,分别模拟汗液头油、老公掉色场景 | 台词:汗液头油;老公掉色
镜6 | 15-20秒 | 中景 | 固定 | 左侧男生拿抽纸擦拭枕芯表面液体,擦完后展示抽纸有污渍,再提起枕芯展示枕面干净无渗透
镜7 | 20-26秒 | 中景 | 固定 | 右侧男生拿起擦过的枕芯,左侧男生拿出充气透气装置,按压气囊展示枕芯透气性,杯上纸巾被气流吹动 | 台词:还透气每一镜独立。台词独立对应。产品材质拆到纤维级别。透气装置精确描述为"黑色手动充气气囊+透明杯具"。
即梦提示词给了 9 个,最后一镜:"两名男生分别手持白色枕头,面向镜头,表情自然放松,暖光居家环境,桌面摆放着同款枕头产品"——直接粘贴即梦就能用。
脚本框架拆出六段:
钩子:开篇直接展示枕头柔软质感+真人躺卧体验,用"好枕头"抓注意力
痛点:倒清水、黄色液体、茶色液体,精准戳中流口水、头油汗渍、伴侣蹭色三大痛点
卖点:按压展示柔软度,擦拭展示防污不渗透,气囊展示透气性——全部可视化实验
促单:两人持枕面向镜头,"来直播间"注意它的镜头语言分析怎么写:
"全程采用固定机位拍摄,无推拉摇移,仅靠人物动作和道具切换完成内容推进,画面稳定"
"节奏紧凑明快,3秒一个卖点节点,全程无冗余镜头"
它没说"沉浸式"三个字。但它把沉浸式的核心机制全拆出来了——固定机位、动作驱动、节点密集、无废话。
这就是理解。不是背答案,是真的看懂了这条视频为什么能跑量。
再看 Gemini。它的镜头分析呢?没有。脚本框架呢?没有。它只给了四个粗糙大段,连"透气测试"是什么装置都写错了。
一个看懂了视频的底层结构。一个只是在描述"看见什么"。
实测二:脚本改写——谁能延续沉浸式?
反推完了。下一步是改写。拿枕头视频的沉浸式框架,改写成另一个品类——夏凉被。
Prompt 里没提"沉浸式"。我只说了:保持结构,换产品,换卖点,换成夫妻场景。
就看模型能不能把沉浸式的魂带过去。
Seed 2.1 Pro 的输出——12 秒,8 镜:
镜1 | 固定机位俯拍,老公侧躺旧被上后背紧贴被面,老婆指尖轻碰后背沾了一手湿汗印 | 无
镜2 | 指尖把毛球和湿汗印对着镜头晃了晃,轻轻皱眉,老公睡懵哼唧一声 | 掉色
镜3 | 老婆把旧被扯到床尾,抱进叠得齐整的浅蓝新夏凉被,指尖捏被角晃了晃 | 无
镜4 | 抖开平铺,光小臂啪得轻贴被面停3秒,蹭了蹭,捏起被角轻弹 | 凉
镜5 | 半杯热水玻璃杯倒扣被面,被面下压干纸巾,10秒后掀开,纸巾完全干爽 | 透气
镜6 | 夏凉被团成球使劲攥紧压成一团,松开手轻抖,瞬间平整蓬松无褶皱 | 无
镜7 | 指尖点了点被面淡黑蹭印,拽过被角搓了搓黑印完全消失,拉过老公往新被里塞 | 可机洗
镜8 | 半撑着身子对镜头抬手指了指屏幕下方,指尖轻轻点了两下 | 直播间8 个镜头。5 个"无"。台词最多的一个字。
全程固定机位。动作驱动。声音轻到几乎没有。
出汗粘被子的痛点——不是靠说,是靠指尖轻碰老公后背沾了一手湿汗印。透气——热水杯倒扣,10 秒后掀开,纸巾干爽。可机洗——团成球攥紧压成一团,松手轻抖,瞬间平整。
这就是沉浸式。
再看 Gemini 3.1 Pro 的输出——604 字,比 Seed 还多:
第一幕:钩子(真人体验)
老公:热死了!这被子太闷了!
老婆:快试试我新买的夏凉被!
老公:哇!好冰!像开了空调一样!
第二幕:痛点(闷热/出汗粘/起球)
老婆:以前的被子,越盖越闷热。
老婆:洗了几次,还疯狂起球!
第三幕:卖点演示(冰感/透气/水洗)
老婆:看这款,黑科技凉感面料。
老婆:一摸上去,瞬间降温超冰爽。
第四幕:促单
老婆:今天厂家直发,超划算!
老婆:左下角小黄车,赶紧去抢!发现问题没有?
分幕。全是老婆在说。老公就一句"热死了"。
"黑科技凉感面料"——天猫详情页文案。"瞬间降温超冰爽"——假到出戏。
而且它把原视频最核心的沉浸式框架彻底丢了。
原视频是固定机位、动作驱动、一气呵成。Gemini 改成了"第一幕→第二幕→第三幕→第四幕"——这是话剧剧本。不是短视频脚本。
它根本没理解那条枕头视频为什么好看。它只是看到了"有个产品,有两个人在演示",然后把模板套上去。
再看 Seed——
冰块放被面10秒化半杯。热水杯蒙被子扣干。洗衣机搅完扯开展示。
全程不切幕。夫妻你一句我一句。卖点在动作里自然出来。
这就是沉浸式。Seed 从反推到改写,全程带着这个魂。Gemini 从头到尾没摸到边。
你觉得哪一个出来的视频能跑量?

为什么豆包在这些场景下完胜?
记住一件事。
豆包是谁家的?
字节跳动。
抖音是谁家的?
也是字节。
这意味着什么?
豆包的训练语料里,有全世界最多的中文短视频脚本。有最多的带货话术。有最多的即梦提示词。有最多的直播切片数据。
GPT 的语料是 Reddit、StackOverflow、英文论文。它写学术论文强,写带货脚本——它连"姐妹们"都不会叫。
Claude 的语料偏西方文化和企业场景。你让它写一个"老公掉色"的梗——它能理解这个笑点才有鬼。
Gemini 的多模态确实强。但它看视频是一个"观察者"视角——"画面中有两个男性,正在操作一个枕头产品"。
Seed 看视频,是"同行拆解"视角——"镜3用了对比蒙太奇把清水黄水茶水并排倒,制造视觉冲击;镜6擦完举起来给特写,这是防污卖点的视觉锚点"。
因为它被训练的数据里,本身就有大量同类内容。它知道带货视频的套路——知道"倒液体测试"是防污品的标配演示,知道"3秒一个卖点"是短视频节奏,知道最后一句必须喊"来直播间"。
这压根不是技术差距。是训练数据的血统。
GPT 的语料是 Reddit、StackOverflow、英文论文。
Claude 的语料偏西方文化和企业邮件。
豆包的语料——抖音每天新增几千万条短视频。直播切片。带货话术。评论区热词。即梦提示词。

你用 GPT 写带货脚本,等于让一个哈佛博士去夜市摆摊。他能说会道但接不住地气。
你用 Seed 2.1 Pro 写带货脚本,等于让一个干了两年的带货主播帮你写文案。他可能解不了微分方程,但他知道第一句说"姐妹们"能留住多少人。
我的结论
网上说豆包垃圾,你听听就得了。
他们测的是代码、数学、逻辑推理。
但你要的是什么?
你要的是 AI 看懂一条视频——不是描述画面,是看懂它为什么能跑量。
那条枕头视频,Seed 看出了沉浸式。Gemini 只看见了"两个人在倒水"。
你要的是 AI 照着框架写一条新脚本——不是换个产品名,是把魂延续过去。
夏凉被脚本,Seed 7 秒产出一条沉浸式。Gemini 产出了一部话剧。
在这些场景下——
Seed 2.1 Pro,完胜。
拳打 Gemini,脚踢 GPT。
下次有人跟你说豆包是玩具——把这篇文章甩给他。
问他:你那个"御三家"模型,能帮你在 9 秒内写完一条能直接拍的夏凉被脚本吗?
不能的话,就别聊了。
我是老汪,干电商14年,抖音直播7年。操盘过生鲜、珠宝玉石、烘焙甜品,单场最高GMV 306万。目前专注AI在电商领域的实际应用,不卖课不割韭菜,只分享自己已经跑通的干货,留个关注吧