# 演示录屏脚本(20–30 秒) README 顶部那张图就是靠这个脚本录出来的。目标只有一个:**让人在 5 秒内看懂"它会说话、而且你能跟它说话"** —— 静态截图讲不清这件事。 ## 录制前 1. 打开 GUI,设置 → 插件 → **MiniMax 语音识别**,确认:朗读开关 **开**、音色选好(建议 `female-shaonv` 或 `male-qn-jingying`)、录音时长上限 **300 秒**。 2. 输入框工具行最右边点一下「**对话**」按钮(图标变红=在听)。 3. 让浏览器窗口占满屏幕,关掉无关的侧栏和标签页;窗口窄一点(≈1000px)比全宽好读。 4. 录制工具:Windows 用 Xbox Game Bar(`Win+G`)或 [ScreenToGif](https://www.screentogif.com/)(后者能直接导出 GIF 并裁掉多余帧,**推荐**)。 ## 镜头(照这个顺序,总长控制在 30 秒内) | # | 画面 | 你要做的事 | 大约时长 | | --- | --- | --- | --- | | 1 | 输入框 + 工具行 | 只演示**一次点击**:点「对话」按钮。停顿一拍,让人看清它变红、开始计时 | 3 s | | 2 | 对话区 | 打一句极短的任务,例如 `看一下这个仓库有多少个提交`,回车 | 4 s | | 3 | 工具调用 → 回复 | 让它自己跑完(**剪辑时把中间等待压掉或 4× 加速**,只留头尾) | 6 s | | 4 | **喇叭念出来** | 回复念完时,把鼠标移到喇叭按钮上让 tooltip 显示「正在朗读」,或让画面上出现播放状态 | 5 s | | 5 | **你说话** | 对着麦克风说一句清楚的短句,例如「好的,再帮我看一下最新那条提交」;字幕标一句 **「我没有碰键盘」** | 5 s | | 6 | 自动发送 | 说完停顿约 1.2 秒 → 文字**自己出现并发出**。这是全片最关键的一帧,**别剪掉这 2 秒** | 4 s | | 7 | 收尾 | 新回复开始念,麦克风仍亮着 | 3 s | ## 剪辑与字幕 - 加 **3 条字幕**(比旁白可靠,也方便发到不静音的场合): 1. `任务跑完 → 用喇叭念一句(不是念正文)` 2. `对着麦克风说一句 —— 我全程没碰键盘` 3. `说完自动发送,念完自动重新开麦` - **提速**:等待模型回复的那段用 4–8×;真正有信息量的(念出来的那一刻、自动发送的那两秒)**保持原速**。 - 尺寸:宽 **1000–1280 px**;GIF 控制在 **6 MB 以内**(GitHub 对超过 10 MB 的图片会拒绝内联渲染)。用 ScreenToGif 导出时选 12–15 fps、256 色即可。 - 可选:开头 1 秒放一个纯色 title 卡("dsh-minimax-asr · 会说话的语音插件"),让人在时间线上就看得懂。 ## 录完之后 1. 把文件存成 **`docs/demo.gif`** 并提交。 2. 改 `README.md` / `README.en.md` 里那张图的一行: ```markdown ![任务做完,喇叭念一句;你说完,它自动发送](docs/demo.gif) ``` (现在是 `docs/demo-placeholder.svg`,换掉路径即可,其余不用动。) 3. 顺便把这张 GIF 也发到 X / 即刻 / B站 —— **同一份素材,一次录制,多处复用**,这比再写十条文案都管用。 ## 注意事项 - 录之前**先试说一句**,确认诊断里 `mic-level` 的 `loudest` 能到 **0.03 以上**(够大才算说话)。低于这个值说明麦克风增益太小:Windows 设置 → 系统 → 声音 → 输入 → 音量调高,或离麦克风近一点。 - 别在录屏时开免手对话后长时间不说话 —— 虽然现在会一直听着不会断(每 5 分钟悄悄翻页),但空白片段进了 GIF 会显得很卡。 - 想表现"它会说话但**不念正文**"这个卖点,镜头 4 里让屏幕上的长回复和喇叭里念的短句**同时可见**,这是这个插件最容易被记住的差异点。