一、项目概述
本项目是一套全开源软硬一体化 DIY AI 语音助手完整解决方案,依托 ESP32-S3 微控制器与 Xiaozhi(小智)语音框架搭建,采用本地音频处理 + 云端大语言模型混合计算架构,实现媲美商用智能音箱的自然语音交互能力。项目全部资料对外开放,包含硬件原理图、PCB 工程、物料清单、3D 打印外壳模型、嵌入式固件源码,开发者可直接复刻硬件,或基于现有框架开展二次定制开发,打造私有化智能语音终端。
区别于简易开发板语音 Demo,本项目面向成品化设计,完成电源系统、声学结构、音频信号链路一体化优化,支持锂电池便携供电,可接入智能家居平台,适合硬件爱好者、嵌入式开发者自制私有语音设备。

二、系统架构设计
项目采用云边混合协同架构,分工明确,平衡设备算力与交互效果:
边缘端(ESP32-S3 本地)
负责麦克风拾音、唤醒词检测、音频降噪、回声消除、语音播放、灯光指示、电源管理、网络通信等实时轻量任务;
云端服务端
承载算力需求高的自然语言理解、大模型对话生成,支持对接通义千问 Qwen、DeepSeek、GPT 系列等主流 LLM;
设备通过 WebSocket 建立低延迟长连接,完成音频流双向传输。
三、硬件方案
1. 核心硬件组成
主控采用 ESP32-S3-WROOM-1-N16R8(16MB Flash + 8MB PSRAM),充足内存满足音频缓存、信号处理需求;搭载双 TDK ICS-43434 数字 MEMS 麦克风阵列,实现波束成形拾音,配合算法抑制环境噪声;MAX98357A D 类音频放大器驱动扬声器输出语音。
电源链路集成 BQ24250 锂电池充电芯片与 MAX2402 稳压芯片,支持 USB-C 快充与锂电池 3.7V 供电,实现便携使用;WS2812B 可编程 RGB 灯带作为状态指示灯,可视化展示待机、唤醒、对话、低电量等工作状态。
2. 结构与 PCB 设计
硬件使用双层定制 PCB,尺寸约 80×60mm,设计时充分考量音频信号完整性、电源噪声抑制、功率芯片散热,同时做声学隔离,降低扬声器发声对麦克风的干扰。配套提供 FDM 3D 打印外壳模型,外壳预留麦克风开孔、扬声器音腔、灯光漫射区域、USB 接口与按键位,优化声学表现。
3. 完整物料清单(BOM)
包含主控、双麦、音频功放、充放电管理芯片、RGB 灯珠、扬声器、Type-C 接口、按键、保护器件、阻容元件等,可直接在立创、Digikey、LCSC 等平台一站式采购。
四、软件功能特性
基础音频链路
基于乐鑫 WakeNet 唤醒词检测,支持自定义唤醒词;
内置音频前端算法:噪声抑制、AEC 回声消除、自动增益控制;
WebSocket 双向音频传输,保障语音交互低延迟。
对话与交互能力
支持多类主流云端大模型接入,实现长上下文连续对话;
支持个性化语音人设、对话记忆,形成持续交互场景;
OTA 远程固件升级,无需拆机重新烧录;
电池电量实时监测,低电量自动提醒;
Web 网页可视化配置面板,上电热点配网,便捷修改 WiFi 与设备参数。
拓展生态
原生兼容 Xiaozhi 技能体系,可对接 Home Assistant 智能家居平台,通过语音指令实现灯光、插座等智能设备控制;支持多语种交互,语言能力取决于后端选用大模型。
五、快速开发部署流程
硬件制作:打样 PCB,采购元器件完成焊接;可选 3D 打印外壳组装;
网络配置:首次上电设备自动创建 WiFi 热点,手机接入热点访问内置网页配置无线网络;也可编译阶段预先写入 WiFi 信息;
云端绑定:前往 Xiaozhi 官方平台注册账号,新建设备获取配对码,完成硬件与云端服务绑定;
功能测试:唤醒词
Hey Wanda触发交互,等待灯光确认后直接下达语音指令,完成对话测试。
六、项目开发进度
✅ 已完成:PCB 设计打样验证、基础固件开发、Xiaozhi 云端对接、基础语音交互、3D 外壳模型设计;
⏳ 规划开发:本地离线 LLM 运行方案、自定义唤醒词训练工具、移动端配置 App、多语种语言扩展包、多设备组网功能。
七、开源说明
本项目主体采用MIT 开源协议,可自由学习、修改、商用;项目内第三方组件遵循各自开源许可:ESP-IDF(Apache 2.0)、Xiaozhi 小智框架(MIT 协议)。
八、适用场景
个人爱好者自制私有化离线 / 云端智能语音音箱;
嵌入式语音交互技术学习、高校课程 / 毕业设计项目;
二次开发,定制行业专用语音终端(语音控制面板、语音采集终端等);
智能家居语音中控节点,搭配 Home Assistant 搭建本地智能家居体系。
