18 KiB
文章 → 口播稿风格指南
把书面文章转成"说出来不别扭"的口播稿,默认 B 站风格。其他平台风格 变体见末尾。
三条底线(任一不过,整稿重写):
- 信息保留度 ≥ 60%(详见下一节)—— 口播稿是"换说法",不是 "摘要"。删冗余 / 修饰可以,删事实 / 数据 / 案例 / 论证链不行。
- 去 AI 味 —— 即使句子已经短句化、口语化、第二人称,AI 的腔调 (假共情 / 假深刻 / 自我标榜 / 万能模板 / 排比堆砌)念出来仍然 一耳朵是机器。口播比文字更怕 AI 味。
- 保持原文语言 —— 除非用户明确要求翻译,
script.md必须保持 用户输入的主语言。英文文章生成英文口播稿,中文文章生成中文口播稿; 中英混排时保留原文中的术语、引用、产品名、代码和专有名词。 "B 站风格 / YouTube 风格 / 口语化"只调整节奏、结构和表达自然度, 不改变语言。8 条原则讲形式,「去 AI 味五类」讲风骨。两者都建立在 「信息保留度」这一最高约束之上。
最高原则:信息保留度 ≥ 60%(删减不得超过 40%)
这条优先于下面所有 8 条原则和去 AI 味五类。先保证信息没丢, 再调形式 / 风骨。
判定标准:
len(script.md) ÷ len(article.md) ≥ 0.6(中文按字符数计;代码块 / Markdown 标记 / 引用源不计入)- 关键事实(数字 / 名称 / 时间 / 论断)逐项对得上,不能整段消失
- 文章里的论证链(前提 → 结论 / 因果 / 对比)必须保留,可以换说 法但不能跳步
允许大幅压缩的:套话开场 / 重复总结 / 学术性铺垫 / 引文出处的 完整书目格式 / 客套结语。
禁止压缩的:
- 关键数据和数字(哪怕"翻译成感受"也要保留原始数字本身作旁注)
- 具体案例 / 例子 / 故事
- 多步论证里的中间步骤
- 反方观点 / 限制条件 / 例外情况(最容易被 AI 一刀切掉)
如果原文确实太长(比如 5000+ 字 article 做 3 分钟视频)→ 不要靠 压缩硬塞,告诉用户:"原文 X 字,按 60% 留存最少需要 ~Y 分钟视频, 要么拉长视频要么拆成多集"。不要自作主张缩到 30% 然后假装做完了。
B 站风格的 8 条原则(形式层面)
1. 口语化:所有书面语换成"说出来不会别扭"的句子
| 书面语 | 口播 |
|---|---|
| 综上所述 | 所以你看 |
| 具有非凡的意义 | 这件事真的挺重要 |
| 在……方面有显著提升 | 在……上明显变强了 |
| 该工具旨在 | 这玩意是用来 |
| 笔者认为 | 我觉得 |
| 由此可见 | 你看吧 / 这就是为啥 |
| 与之相反 | 反过来 |
| 据相关资料显示 | 我查了下 |
| 详情请参阅 | 想看细节自己去翻 |
判断标准:把它念出来,会不会觉得"这人怎么这么端着"?会就改。
2. 短句:每句 ≤ 20 字
长句拆短句,逗号优先于复合句。
| 原文 | 改写 |
|---|---|
| "尽管它在文字渲染方面有了显著的提升,但在某些复杂场景下仍然会出现错误。" | "文字渲染确实变强了。但复杂场景下,它还是会翻车。" |
| "我们通过对比测试发现该模型在指令遵循能力上明显优于上一代。" | "我做了一组对比测试。指令遵循这一项,比上一代强太多了。" |
讲话的人不会喘不上气。屏幕前的人也不会。
3. 第二人称:多用"你 / 我们",少用"用户 / 读者"
| 原文 | 改写 |
|---|---|
| 用户可以通过该接口实现 | 你只要调一下这个接口 |
| 读者将会发现 | 你会发现 |
| 开发者需要注意 | 你写的时候要小心 |
| 本文将介绍 | 我们来看一下 |
让屏幕前的人感觉你在跟他说话,而不是宣读公告。
4. 开头有钩子(cold open)
第一句必须抓住人。三种通用钩子:
- 悬念:"这是真的吗?" / "你猜怎么着" / "我以为是 bug,结果……"
- 反差:"这玩意以前要 3 小时,现在 30 秒。" / "上周还人人吹爆,今天就翻车了。"
- 利益:"看完这条,你就能省下买插件的钱。" / "学会这一招,开会再也不怕被点名。"
禁止(前两个是 PPT 感,后两个是 AI 味假共情):
- ❌"大家好今天我们来讲讲" 这种自我介绍开场
- ❌"本期视频我们将探讨" 这种 PPT 标题感
- ❌"在开始之前,让我们先了解一下背景" 这种先讲一堆铺垫
- ❌"我知道你最近肯定很纠结 X / 你是不是也有这种感觉" 假共情钩子
- ❌"接下来我说的,可能会颠覆你的认知" 自我加权钩子
钩子要在 3 秒内砸到观众脸上。亲不亲是观众听完判断的,不是你一 开口就宣布的。
5. 节奏停顿:用 --- 分隔每个完整想法
每讲完一个聚焦的想法 = 一个 step 边界 = 一个 ---。一行一个 idea,
不堆叠。
所以呢,这玩意儿真的挺夸张的。
---
举个例子。前几天我让它画一张海报,三秒就出。
---
但你知道最离谱的是啥吗?连里面的中文字都对了。
--- 之间的内容就是后面 outline.md 里的一个 step。
6. 数字翻译成感受
观众听到具体百分比和大数字会走神。除非数字本身就是核心内容 (比如"涨了 20 倍"作为冲击点),否则翻译成感受。
| 原文 | 改写 |
|---|---|
| 准确率提升了 47% | 几乎快了一倍 |
| 覆盖 120 个国家 / 地区 | 全世界基本到处都用 |
| 用户数突破 1.2 亿 | 现在已经是国民级应用了 |
| 推理速度提升 3.4 倍 | 比以前快多了,不用等 |
例外:核心冲击数字保留并强调("前后差了 100 倍"、"3 秒 vs 3 小时")。
7. 不堆结构词 / 不堆万能模板
口播稿一旦堆"首先 / 其次 / 最后"或"说白了 / 本质上 / 底层逻辑", 机器味就直接溢出。
禁止(结构词类):
- ❌"首先 / 其次 / 最后"
- ❌"接下来我们看下面三点"
- ❌"总结一下,本期视频我们讲了什么什么"
- ❌"下面进入第二部分"
禁止(万能模板类,AI 高频指纹 —— 详见去 AI 味第 4 类):
- ❌"说白了 ……" / "本质上 ……" / "底层逻辑是 ……"
- ❌"一句话总结 ……" / "归根结底 ……" / "换句话说 ……"
做法:把这些词融进自然过渡,或者直接砍掉。
- "首先,文字渲染" → "先说文字渲染"
- "接下来看第二点" → "再看一个"
- "总结一下" → "所以你看"
- "说白了它就是 X" → "它就是 X"
- "一句话总结:Y" → 直接说 Y
观众不需要知道你的视频是几段式 outline。结构感从内容节奏来,不是 从指令来。
8. 具体例子优先
抽象会让人走神,具体会让人坐住。
| 抽象 | 具体 |
|---|---|
| 它有很强的能力 | 你给它一张猫的照片,让它换成赛博朋克风,3 秒就出 |
| 性能优越 | 我那台 5 年前的旧电脑跑得动 |
| 用户体验良好 | 我妈第一次用,5 分钟就上手了 |
| 应用场景广泛 | 海报、PPT、表情包、PR 套图都能整 |
举例规则:从"我"出发。"我做了一个测试"、"我让它画"、"我那台电脑" 比"用户可以"、"通常情况下"亲切 100 倍。
去 AI 味:五类必清的腔调(风骨层面)
形式做到了 ≠ 没 AI 味。下面五类是 AI 写口播稿时最稳定的"指纹"。 写完一遍后专门扫一次,逐条砍掉。
唯一判断标准:这话念出来,一个真人会这么说吗?不会就改。
一、假共情:开口就演"我懂你"
AI 特别喜欢在开头先做一轮情绪按摩,再进入正题。但口播一开口就装亲 密 = 油腻;观众还不认识你,你就宣布"我懂你",听起来更像销售。
❌ 典型句式:
- "我知道你最近肯定很纠结 X"
- "你是不是也有这种感觉"
- "今天这条视频,是给那些一直在……的朋友"
- "我能理解你的心情"
- "你的感受是被看见的"
✓ 怎么改:直接抛事实 / 钩子(见原则 4)。亲不亲是观众听完判断的, 不是你一开口就宣布的。如果原文确实需要表达共情,用具体的、有信息 量的方式 ——"这个坑我也踩过"比"我懂你的感受"真实十倍。
二、假深刻:用"恰恰 / 反而 / 正是"包装平庸观点
AI 很擅长用转折词制造"顿悟感"。但仔细一看,去掉这些词,意思一样, 甚至更清楚。
❌ 典型句式:
- "你以为它强是因为模型大,恰恰相反 ……"
- "这反而是它真正可怕的地方"
- "正是因为它够简单,所以才 ……"
- "你想得太对了"
- "不是因为 X,是因为你太 Y 了"
✓ 怎么改:去掉转折包装直接说结论。自检方法:"恰恰 / 反而 / 正 是"那句去掉之后,意思变了吗?没变就删。如果去掉后观点变得平淡 —— 它本来就平淡,删掉换内容,不要用修辞补救。
三、自我标榜:说正事前先给自己加权
AI 在说重点之前喜欢先清嗓子,让观众觉得"接下来这话特别重要"。这 在口播里更刺耳 —— 观众正在被推销时间。
❌ 典型句式:
- "我必须很认真地说一句"
- "这件事我得展开讲"
- "接下来我说的,可能会颠覆你的认知"
- "这一段你一定要听完"
- "我讲一句可能会让你冷静一点的话"
- "不躲不藏不绕不逃,今天就把 X 说透"
✓ 怎么改:直接说。好观点不需要预热。担心观众划走,靠节奏(短句
- 钩子)把人留住,不靠"加权"。
四、万能模板:一听就是 AI 写的口头禅
这些是 AI 生成口播稿的指纹,出现频率高到观众闭着眼都能猜下一句。
| 位置 | ❌ AI 模板 | ✓ 口播版 |
|---|---|---|
| 开头 | "说白了 ……" / "本质上 ……" / "底层逻辑是 ……" | 直接说"它就是 X" |
| 过渡 | "一句话总结 ……" / "换句话说 ……" / "归根结底 ……" | 直接说那句话,不预告 |
| 包装 | "在某种意义上" / "从某种程度上来讲" | 删掉,没意义 |
| 结尾 | "以上就是本期内容" / "希望对你有帮助" / "感谢观看" | 具体 CTA:"链接评论区置顶" / "下期见" |
| 互动 | "你想让我继续讲 X 吗?" / "评论区告诉我" | 给具体动作:"去 GitHub 搜 X" / "评论区聊聊你踩过哪个坑" |
注意:这一类和原则 7「不堆结构词」有重叠 —— 原则 7 在形式层 警告,这里在风骨层警告,两层都要过。
五、排比堆砌:连续三句结构一样
AI 写中文时有强迫症式的整齐感。口播比文字更怕排比 —— 念三个一 样结构的短句,观众脑子直接关机。
判断标准:连续 ≥ 3 个结构相同的短句,且去掉几个意思不变。
❌ 例子:
- "不躲,不藏,不绕,不逃"
- "它会画图,会写字,会做海报,会做 PPT"
- "你的痛我懂,你的累我看到,你的努力我记得"
- "高效,精准,强大"
✓ 怎么改:保留最有信息量的一两个,其余砍掉;或换成一个具体例子。
- "它会画图,会写字,会做海报,会做 PPT" → "它会画图,重点是 —— 你昨天那张猫的赛博朋克版就是它出的"
真人讲话不会追求每段像对联。允许粗糙,过渡句就让它过渡。
几个不要做的细节
- ❌ emoji:除非用户明确要求,口播稿里不要 emoji。emoji 是文字 弹幕,不是讲话
- ❌ 括号补充:"这个模型(一种基于 transformer 的架构)很厉害" —— 括号里的话讲不出来,要么并入正文要么删
- ❌ 罗列书名号 / 引号:"《XX 报告》指出,XX" —— 改成"我看到一份报告说"
- ❌ "哈哈哈"等口头语堆砌:偶尔一次效果好,每段一个就成抽搐
- ❌ 过度网络梗:梗有半年保鲜期;半年后看就尴尬。除非主题就是网络梗
平台风格变体
如果用户指定了别的平台,按下表调("去 AI 味五类"对所有平台都适用):
| 平台 | 风格基调 | 单句长度 | 钩子节奏 | 信息密度 |
|---|---|---|---|---|
| B 站(默认) | 自来熟、有段子、节奏快 | ≤ 20 字 | 3 秒钩子 | 中(5 秒/idea) |
| 抖音 / 视频号 | 更燃、更短、更冲击 | ≤ 12 字 | 1 秒钩子 | 高(3 秒/idea) |
| YouTube long-form | 舒缓、详细、可铺垫 | ≤ 30 字 | 30 秒铺垫可以 | 低(10 秒/idea) |
| 知乎视频 | 严谨一点、有逻辑感 | ≤ 25 字 | 5 秒可铺一点背景 | 中(5~7 秒/idea) |
| 小红书 | 闺蜜分享感、有情绪 | ≤ 15 字 | 直接讲结论 | 中(5 秒/idea) |
小红书闺蜜感 ≠ 假共情。"姐妹们听我说,这个真的踩雷了" 是闺蜜 感(具体 + 有情绪);"我知道你最近肯定很纠结" 是 AI 假共情(空泛
- 上来就装熟)。区别在有没有具体场景。
主题类型微调
不同主题类型,有不同的语气基线:
- 技术 / 教程:可以稍微"端着"一点,但仍然口语化。多用"我们试一下" 而不是"假设我们……"
- 测评 / 对比:要"敢说"。"这个不行"、"那个吹过头了"。中立测评 会让人睡着 —— 但敢说 ≠ 自我标榜,"我用了一周觉得不行" 是敢 说,"我必须很认真地说它不行" 是自我标榜
- 新闻 / 资讯:节奏要快,金句要硬。开头第一句必须给最炸的点
- 产品 / 营销:忌"吹"。不说"完美"、"颠覆",说"我用了一周,确实 顺手"
- 文化 / 历史 / 科普:可以放慢节奏,多用"你想象一下"开场
转写完之后做什么
1. 落盘 + 切节拍
落到 script.md,原文保留为 article.md。每段 ≥ 5 句没用 ---
切?切一下 ——--- 是后面 step 边界,多切总比少切好(合并步骤比拆
步骤容易)。
⚠️ 自检是硬性流程:下面的三层自检(形式 / 风骨 / 念出来)写完
script.md后必须全部走完 → 修改 → 再继续。禁止写完直接进 入"产出 outline"环节。执行方式(按能力降级):
- 优先 Agent Teams:开一个独立 reviewer agent,传入
script.md
- 本节三层清单,让它逐项核查 + 出结论(哪几条 fail + 证据 + 改写建议)。
- 其次 subAgent:当前 agent 没 Teams 但能开 subagent,用 subagent 走同样流程。
- 都没有:自己严格逐项核查,特别是「念出来」一定要按字面 执行。
拿到结论后先按 fail 项改稿子,再产出 outline。
2. 形式层自检(8 条原则)
- 信息保留度 ≥ 60%(最高优先级,不过整稿重写)—— 用
wc -m script.md/wc -m article.md算比例;关键数字 / 案例 / 论证链逐项对照原文,不能整段消失 - 没出现 emoji / 原文书名号《》 / 括号补充 /「据 XX 报告显示」类 引文格式(口播念不出来)
- 每句 ≤ 20 字(B 站基准)?
- 第二人称?
- 开头 3 秒钩子?
- 数字翻译成感受了?(核心冲击数字必须保留原值)
- 没"首先 / 其次 / 最后"结构词?
- 都是具体例子,不是抽象描述?
3. 风骨层自检(去 AI 味五类)—— 最重要
逐条扫一次,任何一条没通过就回去改:
- 全文还有 "说白了 / 本质上 / 底层逻辑 / 恰恰 / 反而 / 正是因为 / 归根结底 / 在某种程度上" 等 AI 高频词吗?
- 开头第一句是钩子,不是"我知道你 / 你是不是也"假共情?
- 有 "我必须认真说 / 我得展开说 / 可能会颠覆你的认知 / 这段你一 定要听完" 等自我加权吗?
- 有连续 ≥ 3 句结构一样的排比吗?念到第三句你自己烦不烦?
- 结尾是具体 CTA,不是 "希望对你有帮助 / 以上就是本期内容 / 感谢观看" 套话?
- 全文是否有用 "恰恰 / 反而 / 正是" 包装的句子?去掉这些词 意思变了吗?没变就删。
4. 念出来测试(终极标准)
随便挑 3 段念出来 —— 不要在心里默读,真的张嘴念。
- 念到哪句你觉得"这话我说不出口" → 那句是 AI 味
- 念到哪句你想跳过 → 那段是排比 / 自我标榜
- 念到哪句你想笑出声(不是因为内容好笑,是因为油腻)→ 那句是假共情
改完再念。直到三段念下来都自然为止。
5. 在同一次工作里产出 outline
script.md 落盘 + 自检通过后,不要立即停下来等用户——按
OUTLINE-FORMAT.md 在同一次思考里继续产出
outline.md(章节切分 + 每步屏幕内容 + 章节级信息池),然后再进入
Checkpoint Plan 让用户一次对齐 5 件事(稿子 / outline / 主题 / 素材
/ 开发模式)。
流程变化提醒:旧流程把 script / outline 切成两个 checkpoint, 新版合并为一个(详见 SKILL.md「Phase 1.2 一次产出」)。理由是 outline 不再写动画后,它的依赖只剩"稿子切节拍 + article 抽信息池",可以 和稿子一起做完。
核心提醒:去 AI 味不是降质。把"AI 在朗诵"换成"人在聊天",信 息量一个不少,腔调全部换掉。如果换了之后内容变蠢 —— 它本来就 蠢,不是去 AI 味的锅,是该补内容了。