# 语音设备原型需求书

适用于探索有限语音交互的产品团队。定义一项实用任务，例如回答经批准的展览问题，或查询少量公开操作说明。

## 描述预期用途

明确用户、任务、语言、地点、预计每日交互量与声学条件。说明助手应拒答哪些问题，以及何时转交人工。避免将原型定义成不受限制的通用助手。

## 明确完整技术栈

| 层级 | 问题 |
|---|---|
| 硬件 | 使用哪块开发板、哪些麦克风、扬声器、电源及外壳？ |
| 网络 | Wi-Fi 还是其他连接？离线后如何处理？ |
| 语音 | 使用哪些语音识别与合成服务？支持哪些语言？ |
| 模型 | 哪个版本、部署地区及使用条款？ |
| 内容 | 谁提供、批准和更新答案？ |
| 运营 | 谁维护固件、凭据与后端服务？ |

[小智 ESP32](https://github.com/78/xiaozhi-esp32) 等开放固件可以作为起点。其许可不会自动覆盖所有连接服务、声音、设计或品牌。

## 测试交互

记录任务完成、打断、延迟、理解错误、背景噪声及断网恢复情况。将硬件与后端配置与测试结果一同保存。安静房间里的成功演示不是生产可靠性测试。

## 规划成本与生命周期

区分原型工程和设备制造费用。计入语音与模型用量、内容维护、部署、固件更新、退货及更换。明确后端供应商变更条款或终止服务时如何处理。

量产下单前，确认适用测试、产品权利、工装、最低起订量、质量控制及支持责任。儿童、医疗或其他敏感场景需要进一步评估。

[讨论语音原型](/request-quote?solution=voice-prototypes)
