
无论是 O3 Geekbench 6.5 多核破 1.5 万分的 CPU 成绩,还是 O100 身上通过 3D 堆叠压榨出的 1.22 TB/s 超高带宽,就纸面数据而言,提升确实非常激进。

这次,我们在技术沟通会的现场,体验到了两台搭载全新芯片的工程原型机。
一台是背面加装了主动散热风扇、在断网状态下本地运行大模型的折叠屏原型机;另一台则是打满散热孔、直接在本地跑 120B 大模型的桌面计算终端 AI Cube。
这三颗芯片装进硬件后都有哪些能耐,我们在现场找到了答案。
把风扇塞进折叠屏,本地大模型学会了「秒回」
我们首先体验到的是玄戒 O100 原型机。
这台设备的整体形态类似一台折叠屏手机,但背面并没有常规的多摄模组,取而代之的是一整块金属工程结构件。上方开着圆形的进出风格栅,里面还塞了一颗主动散热风扇。


实测生成速度能达到 303 tokens/s,峰值甚至能冲到 330 tokens/s,还没反应过来,回答就已经铺满了屏幕。

从实际表现上看,这台小米 AI 手机的「原型机」,对于 AI 回答的生成速度已经快过人眼的阅读节奏,无论是复杂文档的即时润色,还是通话过程中的同声传译,AI 都能做到即问即答的跟手体验,同时还能守住完全不依赖网络、数据不出本地的隐私底线。
这也是未来端侧 AI 设备的一大卖点。
小米 AI 电脑原型机,让大模型在本地写代码
看完掌上的折叠屏,再来看看展台旁边这台充满硬核工业风的黑色「方盒子」—— Xiaomi AI Cube「Prototype」。

为了压制内部核心的高负载发热,机身四周密密麻麻开凿了整整 33874 个精密镂空孔,腰线处嵌入了一条低调的环形灯带,底部则排布着一整圈整齐的横向散热鳍片。
这台设备内置了 80 GB 内存(芯片最高可支持 160 GB),运行的是 Android 系统,并在本地直接部署了 120B 参数的大模型。
现场工作人员输入了一段需求,要求模型生成一个钢琴网页,左侧的任务列表迅速开始解析,右侧随后刷出大段前端代码。
不一会儿,屏幕上直接运行起一个功能完整的「Web Audio 在线钢琴」应用,上方有实时音频波形与控制滑块,下方的黑白琴键用手指点击就能即时发声。


这台「方盒子」在办公桌上找到了平衡点:既有小模型随时待命的轻快,又有千亿大模型扎实的逻辑底力,把以往需要专业工作站才能做的事情,变成了一件触手可及的桌面工具。
展台上的这两台设备,展示了工程团队探索端侧算力的两个具体方向。
一台在折叠屏有限的机身里,依靠专用加速芯片拉满内存带宽,跑出了完全离线的即时交互;另一台则借助放开的桌面空间与多芯片协同,在本地稳定运行 120B 的代码生成。
随身设备负责轻量高频的「秒回」,桌面终端承接重度复杂的推理,不同尺寸的硬件各自有了明确的分工。

离线即时响应和本地代码生成,已经变成了看得见、摸得着的真实体验。
或许我们也可以期待一下,小米未来能真正量产「年轻人的第一台 AI 算力中枢」,让每个人都能低门槛在本地跑起属于自己的大模型。