# 语音智能问答机器人操作指南 本文档用于说明语音智能问答机器人 Demo 的常用操作方法。建议使用 Chrome 或 Edge 浏览器,通过 HTTPS 地址访问系统。 ## 1. 打开系统 访问地址: https://voice.780901.xyz 页面顶部会显示连接状态和会话编号。 - 显示“已连接”:服务正常,可以开始使用。 - 显示“连接中”或“已断开”:稍等几秒,系统会自动重连。 - 会话编号:用于排查日志和复盘测试问题。 首次使用时,浏览器会请求麦克风权限;如果要拍照识别,还会请求摄像头或相册权限。请点击允许。 ## 2. 手动录音问答 适合单次提问。 操作步骤: 1. 点击左侧麦克风圆形按钮。 2. 系统会提示麦克风已打开,并在约 1 秒后开始录音。 3. 对着麦克风说出问题。 4. 再次点击麦克风按钮,或说完后等待系统完成录音。 5. 系统会转写语音,显示录音文件和识别文本。 6. 大模型开始思考并返回答案。 7. 答案会显示在左侧对话区,并自动语音播报。 示例: “帮我查一下明天上海的天气。” “上海迪士尼怎么玩?” “帮我总结一下这个景点适不适合带孩子去。” ## 3. 连续聆听模式 适合自然连续对话。 操作步骤: 1. 点击“聆听”按钮。 2. 按钮状态会变成“准备”,随后变成“正在听”。 3. 直接说话即可,不需要每次点击录音。 4. 说完后停顿一下,系统会自动切句、转写并发送给大模型。 5. 机器人播报答案后,会继续回到聆听状态。 6. 再次点击“聆听”按钮,可关闭连续聆听。 按钮状态说明: - 聆听:连续聆听未开启。 - 准备:正在申请麦克风和初始化音频。 - 正在听:系统正在监听你的声音。 - 录音中:检测到你正在说话,正在录音。 - 思考中:语音已发送,大模型正在处理。 - 播报中:机器人正在朗读答案。 - 已打断:检测到打断或手动停止播报。 使用建议: - 说完一句话后停顿 1 到 2 秒,系统更容易准确切句。 - 尽量靠近麦克风,避免背景噪音太大。 - 如果一句话很长,可以自然分段说,系统会尽量合并连续内容。 ## 4. 打断播报 机器人播报时,可以随时打断。 方式一:语音打断 在连续聆听模式下,机器人播报时直接说话,系统会尝试停止播报并开始录音。 也可以说打断词: - 停一下 - 等一下 - 停止 - 别说了 方式二:按钮打断 点击“停止”按钮,系统会立即停止当前播报。 方式三:点击麦克风 在非连续聆听模式下,机器人播报时点击麦克风,会停止播报并准备录音。 ## 5. 实时转写窗口 右侧“实时转写”区域用于查看当前语音状态。 字段说明: - 状态:显示正在听、录音中、正在转写、大模型思考中等状态。 - 捕获:显示浏览器实时捕获到的语音片段。 - 转写:显示服务端 ASR 识别后的文本。 - 队列:显示连续聆听模式下等待合并发送的语音内容。 如果你说了很多但转写很少,可以重点观察: - 状态是否进入“录音中”。 - 捕获是否有内容。 - 转写是否为空。 - 队列是否一直为空。 这些信息可以帮助判断是麦克风权限、环境噪声、VAD 切句,还是 ASR 识别问题。 ## 6. 拍照识别 适合移动端拍照、识别物品、票据、屏幕、菜单、景点牌等。 操作步骤: 1. 点击“拍照”按钮。 2. 手机端会打开摄像头或相册。 3. 拍照或选择图片。 4. 系统上传图片并调用视觉理解能力。 5. 识别结果会显示在对话区,并自动播报。 示例: “拍一下菜单,让机器人帮我看看有什么推荐。” “拍景区导览图,让机器人帮我提取重点。” “拍票据、屏幕或说明牌,让机器人读出关键信息。” 注意: - 图片尽量清晰、光线充足。 - 文字内容尽量不要倾斜太严重。 - 图片过大时可能上传失败,可以重新拍一张更小的。 ## 7. 联网搜索问答 适合查询实时信息、天气、新闻、攻略、价格、政策、公司人物动态等。 示例: “帮我查一下上海明天的天气。” “上海迪士尼今天有什么攻略?” “最近张雪机车拿冠军了吗?” 系统会优先使用 MiniMax 工具能力进行联网搜索;如果官方工具暂时不可用,会尝试本地兜底搜索。 体验说明: - 对实时问题,系统可能先给一个简短回复,再继续搜索并补充正式回答。 - 如果搜索较慢,请等待几秒。 - 如果回答里出现“搜索失败”或“没找到”,可以换一个更明确的问题再试。 ## 8. 生成音乐 音乐生成采用确认流程,避免直接消耗音乐额度。 完整流程: 1. 你提出音乐需求。 2. 系统追问音乐选项。 3. 你按选项回复。 4. 系统先生成歌词草稿。 5. 你确认歌词。 6. 系统才开始调用音乐生成接口。 7. 音乐生成完成后,页面会显示播放器和音乐文件链接。 示例需求: “我想把主题乐园攻略生成一首歌。” 系统会追问: 问题1:选择音乐风格 - 选项一:流行温暖(默认) - 选项二:轻快儿歌 - 选项三:摇滚动感 - 选项四:民谣治愈 问题2:选择人声 - 选项A:女声(默认) - 选项B:男声 - 选项C:合唱 - 选项D:纯音乐 问题3:选择歌词来源 - 选项甲:用刚才歌词 - 选项乙:让我自动写(默认) - 选项丙:只做纯音乐 你可以回复: “二 A 乙” 意思是: - 轻快儿歌 - 女声 - 让系统自动写歌词 系统会先生成歌词草稿,并提示: “如果可以,请说确认生成。如果要改,请直接说修改要求。” 确认方式: - 确认生成 - 可以 - 就这样 - 开始生成 - 没问题 修改方式: - 改成男声更摇滚 - 歌词短一点 - 副歌更朗朗上口 - 不要太幼稚 - 改成纯音乐 取消方式: - 取消 - 不生成 - 算了 - 先不要 注意: - 确认前不会调用音乐生成接口。 - 确认后才会消耗音乐生成额度。 - 为避免审核失败,系统会自动替换真实品牌名和受版权保护角色名。 - 生成完成后会显示音乐时长,方便判断是否生成了完整歌曲。 ## 9. 历史记忆和快速回复 系统会记录历史问答,用于后续快速参考。 当你问到类似问题时,系统可能会先播报一段历史摘要,再继续搜索最新信息。 适合场景: - 经常问同一类旅行攻略。 - 连续规划同一个城市的行程。 - 多次询问同一个主题,如天气、美食、景点。 注意: - 历史摘要只是参考,不代表最新信息。 - 对天气、价格、营业时间等实时问题,应以正式搜索结果为准。 ## 10. 常见问题 ### 10.1 没有声音或不能录音 处理方法: 1. 确认使用 Chrome 或 Edge。 2. 确认访问的是 HTTPS 地址。 3. 检查浏览器麦克风权限是否允许。 4. 检查系统麦克风是否被其他软件占用。 5. 刷新页面后重试。 ### 10.2 连续聆听没有反应 处理方法: 1. 看按钮是否显示“正在听”。 2. 看实时转写里的“捕获”是否有内容。 3. 靠近麦克风重新说一遍。 4. 减少背景噪声。 5. 关闭聆听后重新开启。 ### 10.3 识别内容不完整 可能原因: - 说话音量太小。 - 停顿太长,被系统切成多段。 - 背景噪声太大。 - 麦克风离人太远。 建议: - 语速稍慢一点。 - 一次说一个完整问题。 - 长问题可以分两句说,但不要停顿太久。 ### 10.4 播报和聆听冲突 系统支持打断播报,但极端情况下可能会把机器人声音当成人声。 建议: - 需要打断时直接说“停一下”或点击“停止”。 - 如果机器人播报时误触发录音,可以等待它恢复“正在听”后再说。 - 环境回声较大时,适当降低设备外放音量。 ### 10.5 音乐生成失败 可能原因: - MiniMax 音乐接口审核拦截。 - 歌词包含真实品牌、角色、翻唱或敏感内容。 - 网络或接口临时失败。 - 音乐额度不足。 建议: - 使用系统生成的安全歌词草稿。 - 避免说“翻唱”“模仿某歌手”“某品牌官方歌曲”等。 - 如果失败,修改歌词后重新确认生成。 ### 10.6 搜索失败或信息不新 可能原因: - MiniMax MCP 搜索暂时不可用。 - 外部搜索结果质量不稳定。 - 问题太宽泛。 建议: - 加上地点、日期、对象名称。 - 例如把“天气怎么样”改成“上海明天 2026 年 5 月 19 日天气怎么样”。 - 把“这个乐园怎么玩”改成“上海迪士尼一日游攻略,亲子路线”。 ## 11. 推荐使用方式 单次问题: 点击麦克风,说完问题后等待回答。 连续聊天: 点击“聆听”,自然说话,说完停顿一下。 需要停止播报: 说“停一下”或点击“停止”。 需要视觉识别: 点击“拍照”,拍摄图片后等待识别结果。 需要生成音乐: 先说需求,按选项补充,确认歌词后再生成。 ## 12. 测试时建议记录的信息 如果出现问题,建议记录: - 会话编号。 - 问题发生时间。 - 当时按钮状态。 - 实时转写里的“捕获”和“转写”内容。 - 是否连续聆听模式。 - 是否正在播报时打断。 - 生成音乐时选择的选项。 - 页面显示的错误提示。 这些信息可以帮助快速定位 ASR、TTS、搜索、MCP、音乐接口或前端交互问题。