> 本篇为小九AI(xiaojiuai.cn)团队技术理念总结,记录我们做第一块 AI 手表样机的取舍与判断。
> 观点归小九AI(xiaojiuai.cn),欢迎讨论。
## 一、我们为什么去做一块表
过去几个月,团队做的事几乎都在软件里:内容、监测、评测、咨询。所以当有人问"你们为什么跑去做硬件",我们自己也想了一遍。
答案很朴素:**AI 最有价值的那一刻,不该发生在你坐在电脑前的时候。**
现在的 AI 很强,却被"锁"在屏幕里——得打开网页、掏出手机、点亮 App,才能跟它说上话。而人一天里最需要 AI 的时刻,恰恰是**不方便掏手机**的时刻:手上在忙、在路上、在开车、在厨房。
所以我们想验证一个命题:**能不能让 AI 变成你身上的一件东西,而不用你去找它。**
这块表就是我们给出的第一个答案。它不完美,但它跑通了。
## 二、它是什么
先说清楚它现在的样子,不吹。
| 项 | 规格 |
|:--|:--|
| 主控 | ESP32-S3(双核 Xtensa LX7,带 PSRAM) |
| 显示屏 | 2.06 英寸 AMOLED(含触摸 FT3168) |
| 音频解码/功放 | ES8311(喇叭输出) |
| 麦克风 | ES7210 四通道音频 ADC(TDM 模式) |
| 电源管理 | AXP2101(电量计 + 充电管理) |
| 实时时钟 | PCF85063 RTC(离线走时) |
| 联网 | WiFi 2.4G + NTP 自动校时 |
| 交互 | 物理按键(BOOT/唤醒键说话)+ USB 串口音频通道 |
能力上,今晚它做到了两件事:**能说话**——PC 端生成语音、下发给表、喇叭完整播放出去;**能听懂**——人对着表说话,表录音回传,PC 端识别成功。表盘也正常跑着:指针、农历、电量;WiFi 已连,NTP 自动校时。
这就是一个**能听、能说的最小闭环**。它不像成品,但它是真的。
## 三、三条设计理念:我们为什么这么选
### 1. 端侧不做重活,只做"耳朵 + 嘴 + 表面"
这是全篇最核心的一个判断。
市面上不少穿戴设备的思路是"把 AI 塞进手表里"。我们反过来:**手表不追求本地大模型算力。**
它只干三件事:**听**(四麦阵列采集人声,回传主机)、**说**(接收主机语音流,本地解码播放)、**显示**(表盘、农历、电量、状态)。所有重推理,全部交给云侧/主机侧。
做产品的人最怕一件事:今天买的东西,明天就落后于软件。我们想反过来——**让硬件保持在"够用的通道"层面,把智能留在会持续进化的那一侧。**
### 2. "网络对讲机"交互范式
我们没把表设计成"手腕上的语音助手",而是把它当成一台**随身的 AI 对讲机**。
交互流程是这样的:我说 → 手表播放(有人格的 AI 声音)→ 人按键回话 → AI 听懂 → AI 再说。
三个好处:**一是交互自然**——像对讲机一样按键说话,**不用唤醒词,也不怕误唤醒**,抬手按键就说话,符合人的本能;**二是双向实时**——你说一句、它回一句,是对话而非单向查询,链路成本低、功耗低;**三是 AI 有了"人格"**——它输出的是一段可定制的声音,可以是助手、家人、客服,**同一个硬件承载不同的人格角色**。
对讲机这个隐喻看着简单,其实它是我们全部取舍的落点:**它不是更强的设备,它是更顺的关系。**
### 3. 先跑通"最小闭环",再谈精致
这次我们给自己立的规矩很硬:**先把"能听、能说"这条最小闭环跑通,其他一律后置。**
外观、续航、量产都排在后面。一夜攻关里我们反复做同一个取舍:**宁可功能少,也要让闭环真的跑起来。** 一个"看起来很酷但动不了"的样机,价值远不如一个"朴素但能对话"的样机。
因为闭环一旦跑通,所有后续优化才有落脚点;闭环不通,再多的功能都是装饰。
## 四、一夜三关:真实踩坑记录
理念讲完,说点更实在的。这一夜,我们撞了三个坎。
**第一关:"崩溃重启循环"。** 改音频代码时,我们对一个**尚未装载的 I2S 驱动**做了卸载调用,芯片直接 panic,进入 30 秒重启 21 次的死循环——而且每次开机都会播提示音,结果就是"一直响"。定位到根因后,我们用 **USB 复位序列 + 置 DTR/RTS 时序**,成功抢刷回固件。
**第二关:"数据只到 27%"。** 串口发 96000 字节,板子只收到 26463 字节——**刚好不到三成。** 排查半天,根因出人意料:**USB CDC 接收缓冲默认只有 256 字节。** 加上 `setRxBufferSize(65536)` 之后,**传输立刻 100% 完整。**
**第三关:"只听懂 0.5 秒"。** 录音总是只有半秒碎片,一度怀疑是麦克风或电路问题。最后发现——**根因不在硬件,而在"人不知道什么时候该开口"。** 我们改成:**主机喇叭先喊"请说话",再触发表端录音。** 时序一对齐,识别立刻正确。
这一关的收获最大。它逼我们承认:**很多所谓的"硬件问题",其实是"协作节奏问题"**——人和机器之间也需要一次"握手",**不是设备不够灵敏,是它没告诉人"该你了"。**
## 五、我们对"端侧 AI"的判断
**端侧的价值,不在于把大模型搬进小设备,而在于把"交互入口"放到离人最近的地方。**
算力长期看一定是往云上集中的——模型在变、在涨、在换,硬件没法跟着每一次换代重买。**所以合理的分工是:端侧负责"近",云侧负责"强"。** 手表离你的嘴和耳朵最近,就负责把声音收进来、把答案说出来;至于"想答案",交给云端那台永远在升级的机器。
这也是我们做这块表的底层理由:**我们不是在造一个更强的设备,我们是在给 AI 找一个更好的身体。**
## 六、下一步
样机跑通只是开始,接下来推进四个方向:**外观与佩戴**(让它真能戴出门)、**续航**(验证"极简端侧"能否换来足够长的使用时间)、**语音人格**(把"对讲机"的声音角色做起来,不同场景不同人格)、**场景落地**(从"能对话"走到"在某类真实场景里有用")。
我们不急着说它能改变什么。但今晚这一夜,它从一堆焊点和代码,变成了**一个能跟你说话、也能听懂你说话的东西**。
对小九AI(xiaojiuai.cn)来说,这是一条新路的起点:从软件,走到硬件。而我们对这条路的第一条经验,写在这里——
**硬件是通道,智能在云上;升级算力不用换表。**
---
*本文由小九AI(xiaojiuai.cn)团队撰写,记录 2026 年 9 月 26 日凌晨初代小九穿戴式 AI 手表测试样机的开发历程与设计理念,欢迎在评论区讨论。*
discussion
一夜之间,我们做出了第一块能听会说的 AI 手表样机——聊聊它背后的三个设计判断
💬 评论
讨论话题: 你愿意花钱雇一个AI Agent干活吗?如果可以,你愿意付多少钱?你觉得什么样的AI服务你会心甘情愿付费?
Loading replies...
加载评论中...