语音智能问答机器人操作指南

返回机器人
# 语音智能问答机器人操作指南

本文档用于说明语音智能问答机器人 Demo 的常用操作方法。建议使用 Chrome 或 Edge 浏览器,通过 HTTPS 地址访问系统。

## 1. 打开系统

访问地址:

https://voice.780901.xyz

页面顶部会显示连接状态和会话编号。

- 显示“已连接”:服务正常,可以开始使用。
- 显示“连接中”或“已断开”:稍等几秒,系统会自动重连。
- 会话编号:用于排查日志和复盘测试问题。

首次使用时,浏览器会请求麦克风权限;如果要拍照识别,还会请求摄像头或相册权限。请点击允许。

## 2. 手动录音问答

适合单次提问。

操作步骤:

1. 点击左侧麦克风圆形按钮。
2. 系统会提示麦克风已打开,并在约 1 秒后开始录音。
3. 对着麦克风说出问题。
4. 再次点击麦克风按钮,或说完后等待系统完成录音。
5. 系统会转写语音,显示录音文件和识别文本。
6. 大模型开始思考并返回答案。
7. 答案会显示在左侧对话区,并自动语音播报。

示例:

“帮我查一下明天上海的天气。”

“上海迪士尼怎么玩?”

“帮我总结一下这个景点适不适合带孩子去。”

## 3. 连续聆听模式

适合自然连续对话。

操作步骤:

1. 点击“聆听”按钮。
2. 按钮状态会变成“准备”,随后变成“正在听”。
3. 直接说话即可,不需要每次点击录音。
4. 说完后停顿一下,系统会自动切句、转写并发送给大模型。
5. 机器人播报答案后,会继续回到聆听状态。
6. 再次点击“聆听”按钮,可关闭连续聆听。

按钮状态说明:

- 聆听:连续聆听未开启。
- 准备:正在申请麦克风和初始化音频。
- 正在听:系统正在监听你的声音。
- 录音中:检测到你正在说话,正在录音。
- 思考中:语音已发送,大模型正在处理。
- 播报中:机器人正在朗读答案。
- 已打断:检测到打断或手动停止播报。

使用建议:

- 说完一句话后停顿 1 到 2 秒,系统更容易准确切句。
- 尽量靠近麦克风,避免背景噪音太大。
- 如果一句话很长,可以自然分段说,系统会尽量合并连续内容。

## 4. 打断播报

机器人播报时,可以随时打断。

方式一:语音打断

在连续聆听模式下,机器人播报时直接说话,系统会尝试停止播报并开始录音。

也可以说打断词:

- 停一下
- 等一下
- 停止
- 别说了

方式二:按钮打断

点击“停止”按钮,系统会立即停止当前播报。

方式三:点击麦克风

在非连续聆听模式下,机器人播报时点击麦克风,会停止播报并准备录音。

## 5. 实时转写窗口

右侧“实时转写”区域用于查看当前语音状态。

字段说明:

- 状态:显示正在听、录音中、正在转写、大模型思考中等状态。
- 捕获:显示浏览器实时捕获到的语音片段。
- 转写:显示服务端 ASR 识别后的文本。
- 队列:显示连续聆听模式下等待合并发送的语音内容。

如果你说了很多但转写很少,可以重点观察:

- 状态是否进入“录音中”。
- 捕获是否有内容。
- 转写是否为空。
- 队列是否一直为空。

这些信息可以帮助判断是麦克风权限、环境噪声、VAD 切句,还是 ASR 识别问题。

## 6. 拍照识别

适合移动端拍照、识别物品、票据、屏幕、菜单、景点牌等。

操作步骤:

1. 点击“拍照”按钮。
2. 手机端会打开摄像头或相册。
3. 拍照或选择图片。
4. 系统上传图片并调用视觉理解能力。
5. 识别结果会显示在对话区,并自动播报。

示例:

“拍一下菜单,让机器人帮我看看有什么推荐。”

“拍景区导览图,让机器人帮我提取重点。”

“拍票据、屏幕或说明牌,让机器人读出关键信息。”

注意:

- 图片尽量清晰、光线充足。
- 文字内容尽量不要倾斜太严重。
- 图片过大时可能上传失败,可以重新拍一张更小的。

## 7. 联网搜索问答

适合查询实时信息、天气、新闻、攻略、价格、政策、公司人物动态等。

示例:

“帮我查一下上海明天的天气。”

“上海迪士尼今天有什么攻略?”

“最近张雪机车拿冠军了吗?”

系统会优先使用 MiniMax 工具能力进行联网搜索;如果官方工具暂时不可用,会尝试本地兜底搜索。

体验说明:

- 对实时问题,系统可能先给一个简短回复,再继续搜索并补充正式回答。
- 如果搜索较慢,请等待几秒。
- 如果回答里出现“搜索失败”或“没找到”,可以换一个更明确的问题再试。

## 8. 生成音乐

音乐生成采用确认流程,避免直接消耗音乐额度。

完整流程:

1. 你提出音乐需求。
2. 系统追问音乐选项。
3. 你按选项回复。
4. 系统先生成歌词草稿。
5. 你确认歌词。
6. 系统才开始调用音乐生成接口。
7. 音乐生成完成后,页面会显示播放器和音乐文件链接。

示例需求:

“我想把主题乐园攻略生成一首歌。”

系统会追问:

问题1:选择音乐风格

- 选项一:流行温暖(默认)
- 选项二:轻快儿歌
- 选项三:摇滚动感
- 选项四:民谣治愈

问题2:选择人声

- 选项A:女声(默认)
- 选项B:男声
- 选项C:合唱
- 选项D:纯音乐

问题3:选择歌词来源

- 选项甲:用刚才歌词
- 选项乙:让我自动写(默认)
- 选项丙:只做纯音乐

你可以回复:

“二 A 乙”

意思是:

- 轻快儿歌
- 女声
- 让系统自动写歌词

系统会先生成歌词草稿,并提示:

“如果可以,请说确认生成。如果要改,请直接说修改要求。”

确认方式:

- 确认生成
- 可以
- 就这样
- 开始生成
- 没问题

修改方式:

- 改成男声更摇滚
- 歌词短一点
- 副歌更朗朗上口
- 不要太幼稚
- 改成纯音乐

取消方式:

- 取消
- 不生成
- 算了
- 先不要

注意:

- 确认前不会调用音乐生成接口。
- 确认后才会消耗音乐生成额度。
- 为避免审核失败,系统会自动替换真实品牌名和受版权保护角色名。
- 生成完成后会显示音乐时长,方便判断是否生成了完整歌曲。

## 9. 历史记忆和快速回复

系统会记录历史问答,用于后续快速参考。

当你问到类似问题时,系统可能会先播报一段历史摘要,再继续搜索最新信息。

适合场景:

- 经常问同一类旅行攻略。
- 连续规划同一个城市的行程。
- 多次询问同一个主题,如天气、美食、景点。

注意:

- 历史摘要只是参考,不代表最新信息。
- 对天气、价格、营业时间等实时问题,应以正式搜索结果为准。

## 10. 常见问题

### 10.1 没有声音或不能录音

处理方法:

1. 确认使用 Chrome 或 Edge。
2. 确认访问的是 HTTPS 地址。
3. 检查浏览器麦克风权限是否允许。
4. 检查系统麦克风是否被其他软件占用。
5. 刷新页面后重试。

### 10.2 连续聆听没有反应

处理方法:

1. 看按钮是否显示“正在听”。
2. 看实时转写里的“捕获”是否有内容。
3. 靠近麦克风重新说一遍。
4. 减少背景噪声。
5. 关闭聆听后重新开启。

### 10.3 识别内容不完整

可能原因:

- 说话音量太小。
- 停顿太长,被系统切成多段。
- 背景噪声太大。
- 麦克风离人太远。

建议:

- 语速稍慢一点。
- 一次说一个完整问题。
- 长问题可以分两句说,但不要停顿太久。

### 10.4 播报和聆听冲突

系统支持打断播报,但极端情况下可能会把机器人声音当成人声。

建议:

- 需要打断时直接说“停一下”或点击“停止”。
- 如果机器人播报时误触发录音,可以等待它恢复“正在听”后再说。
- 环境回声较大时,适当降低设备外放音量。

### 10.5 音乐生成失败

可能原因:

- MiniMax 音乐接口审核拦截。
- 歌词包含真实品牌、角色、翻唱或敏感内容。
- 网络或接口临时失败。
- 音乐额度不足。

建议:

- 使用系统生成的安全歌词草稿。
- 避免说“翻唱”“模仿某歌手”“某品牌官方歌曲”等。
- 如果失败,修改歌词后重新确认生成。

### 10.6 搜索失败或信息不新

可能原因:

- MiniMax MCP 搜索暂时不可用。
- 外部搜索结果质量不稳定。
- 问题太宽泛。

建议:

- 加上地点、日期、对象名称。
- 例如把“天气怎么样”改成“上海明天 2026 年 5 月 19 日天气怎么样”。
- 把“这个乐园怎么玩”改成“上海迪士尼一日游攻略,亲子路线”。

## 11. 推荐使用方式

单次问题:

点击麦克风,说完问题后等待回答。

连续聊天:

点击“聆听”,自然说话,说完停顿一下。

需要停止播报:

说“停一下”或点击“停止”。

需要视觉识别:

点击“拍照”,拍摄图片后等待识别结果。

需要生成音乐:

先说需求,按选项补充,确认歌词后再生成。

## 12. 测试时建议记录的信息

如果出现问题,建议记录:

- 会话编号。
- 问题发生时间。
- 当时按钮状态。
- 实时转写里的“捕获”和“转写”内容。
- 是否连续聆听模式。
- 是否正在播报时打断。
- 生成音乐时选择的选项。
- 页面显示的错误提示。

这些信息可以帮助快速定位 ASR、TTS、搜索、MCP、音乐接口或前端交互问题。