适用于探索有限语音交互的产品团队。定义一项实用任务,例如回答经批准的展览问题,或查询少量公开操作说明。
描述预期用途
明确用户、任务、语言、地点、预计每日交互量与声学条件。说明助手应拒答哪些问题,以及何时转交人工。避免将原型定义成不受限制的通用助手。
明确完整技术栈
| 层级 | 问题 |
|---|---|
| 硬件 | 使用哪块开发板、哪些麦克风、扬声器、电源及外壳? |
| 网络 | Wi-Fi 还是其他连接?离线后如何处理? |
| 语音 | 使用哪些语音识别与合成服务?支持哪些语言? |
| 模型 | 哪个版本、部署地区及使用条款? |
| 内容 | 谁提供、批准和更新答案? |
| 运营 | 谁维护固件、凭据与后端服务? |
小智 ESP32 等开放固件可以作为起点。其许可不会自动覆盖所有连接服务、声音、设计或品牌。
测试交互
记录任务完成、打断、延迟、理解错误、背景噪声及断网恢复情况。将硬件与后端配置与测试结果一同保存。安静房间里的成功演示不是生产可靠性测试。
规划成本与生命周期
区分原型工程和设备制造费用。计入语音与模型用量、内容维护、部署、固件更新、退货及更换。明确后端供应商变更条款或终止服务时如何处理。
量产下单前,确认适用测试、产品权利、工装、最低起订量、质量控制及支持责任。儿童、医疗或其他敏感场景需要进一步评估。