首页 / 文章 / 我把Hailo 8塞进掌机,从此推理不再花钱
← 返回
IT技术

我把Hailo 8塞进掌机,从此推理不再花钱

✍️ zhirenhun 📅 2026/7/18 👁 165 阅读 ⏱ 14 分钟
我把Hailo 8塞进掌机,从此推理不再花钱

我把Hailo 8塞进掌机,从此推理不再花钱

云端AI是个订阅陷阱。我造了个能塞进夹克口袋、功耗仅3瓦的退出方案。

我厌倦了为思考支付租金。

每个酷炫的演示最终都殊途同归:注册API密钥、绑定信用卡、看着token蒸发的同时别人在记录你的提示词。我想要一台能看、能理解、能推理的设备,无需向俄勒冈的数据中心发送信号。于是我把一块26 TOPS的AI加速器塞进手持电脑,彻底剪断了脐带。

这就是我的做法、遇到的坑,以及为什么你也该试试。

推理税正在扼杀你的项目

我们习以为常的某些事其实很荒谬。我们把最私密的计算任务——比如查看自己的照片、转录自己的语音笔记、检测自家后院的物体——都交给企业去处理。

这不只是钱的问题,虽然钱确实令人恼火。视觉功能五美元,嵌入功能二十美元,项目稍有起色又要五十美元。更致命的是脆弱性:WiFi断连时你的机器人就罢工了;供应商调整定价时你的现场工具就废了;号称注重隐私的应用其实毫无隐私可言,因为每一帧画面都发往你无法控制的端点。

我在为硬件开发工作打造一款口袋侦察工具。它需要实时物体检测、车牌模糊处理,以及后续的本地视觉问答。用云端API意味着延迟、成本和我不想留下的数字足迹。在Pi 5 CPU上本地运行,帧率只有约2FPS,CPU还会热到降频罢工。

我需要专用芯片。不是巨型GPU,而是一把手术刀。

遇见Hailo-8,这个价位不该存在的芯片

如果你还没玩过Hailo-8,它以一种最棒的方式显得另类。这是块M.2 2242或2280模块,外观像SSD,负载功耗约2.5到3瓦,标称26 TOPS。虽然这是INT8峰值数据,但即便考虑实际开销,在这个功耗范围内它绝对碾压任何CPU或集成GPU。

更重要的是,它专为边缘计算而生。它不需要硕大的风扇,只需要一条PCIe通道和一项任务。物体检测、姿态估计、分割、深度、人脸识别、CLIP嵌入、小型视觉Transformer——所有你曾花500毫秒/次请求付费给OpenAI或Google做的事。

我把它与树莓派5 8GB版配对。不是因为它最强,而是因为它容易获取、通过FPC暴露了真正的PCIe通道,而且社区已经解决了电源和NVMe这些无聊问题。

我的基础配置:
树莓派5 8GB 配主动散热器
Pimoroni NVMe底座 配1TB NVMe存储模型和数据集
Hailo-8 M.2 M key模块 装在NVMe底座上或通过PCIe交换机连接
Waveshare 4.3寸DSI触摸屏 或类似手持外壳
10000mAh PD电池 支持5V 5A输出
PiSugar或定制UPS 实现安全关机

总成本约220到280美元,取决于你能淘到多少配件。这还不到六个月的中档云推理费用——如果你真的在用这些工具。

如果你想知道精确的接线、导热垫布局,以及哪些NVMe HAT能同时提供NVMe插槽和M.2 E key给Hailo而不争抢通道,我把所有细节都放在了 离线AI赛博甲板包 里。它涵盖了Pi 5 NVMe构建、Hailo-8集成、Pico W副手(用于键盘和传感器输入),以及后续添加第二块Pi的集群方案。这帮我省下了三个报废的M.2转接器。

打造不像是科学实验的手持设备

大多数赛博甲板看起来像烂片里的炸弹:到处是线、裸露的PCB、电池靠祈祷固定。我想要真正能随身携带的东西。

我用ASA材料打印了分体式外壳——两片式翻盖设计,在Pi 5主动散热器和Hailo模块上方直接开了通风口。Hailo-8会发热但不至于烫手,只需给它贴个导热垫到外壳或加个小铜片。我用1.5mm软垫连接铝制NVMe散热器,温度瞬间降了18°C。

电源才是真正的设计约束。Pi 5很挑剔:给它不稳定的5V电压,它就会降频并嘲笑你。我用PD触发板从20V PD充电宝获取5V 5A输出,而不是那些负载下电压会掉到4.6V的廉价USB充电宝。稳定的电源等于稳定的PCIe,等于Hailo不会在推理中途消失。

操作系统方面,我运行树莓派OS Lite 64位,内核6.6,搭配HailoRT 4.18。现在驱动安装已经毫无痛苦——一年前可不是这样。模型库确实实用:YOLOv8m、YOLOv8 pose、MobileNet、ArcFace,都已为Hailo预编译。自定义模型需要用他们的Dataflow Compiler编译,在Docker中运行,确实需要一些学习成本。

真正让人顿悟的时刻,是运行hailortcli run yolov8m.hef时看到120+ FPS,而这块芯片的功耗比你的键盘背光还低。那一刻你才意识到自己一直被坑了。

软件地狱才是乐趣所在

硬件很简单。软件才是大多数人放弃、回去每月付给Sam Altman 20美元的原因。

你必须重新思考你的流水线。你不再调用端点,而是在构建数据流。

我的技术栈是这样的:

摄像头通过libcamerapicamera2 -> 在CPU上尽可能零拷贝预处理 -> Hailo推理 -> 用NumPy或C++(需要速度时)后处理 -> 结果输入本地LLM或显示在屏幕叠加层。

对于视觉语言任务,我在Pi 5 CPU上用llama.cpp运行量化版LLaVA或Moondream 2,但图像嵌入来自Hailo。这种混合方案堪称魔法:Hailo做它最擅长的——大规模并行张量运算;CPU做它最擅长的——顺序逻辑和token生成。“我在看什么”的延迟从云端往返的1.8秒降到了完全离线的约0.4秒。

是的,你将活在终端里。你将与GStreamer搏斗。你会学到比你想要的更多的hailo_platform知识。这就是重点。你不再是一个提示工程师,而是重新成为一个操作员。

我把整个流程整合到了一起——dotfiles、udev规则、hailort服务文件、用于模型切换的bash包装器——变成了我现在每次构建都复用的设置。如果你讨厌花三个小时调试驱动,最后才发现忘了dtparam=pciex1,那么终端操作员包就是那个系统。它把Black Terminal、Seamless Terminal、Bash Necromancer、Defensive Scripters和Scriptkit集于一身。它将树莓派从一个玩具变成了一个你可以在现场实际使用、不会想扔掉的工作站。

口袋里26 TOPS的真实感受

让我具体说明,因为模糊的承诺是给AI初创公司的。

在电池供电、手持、没有风扇尖叫的情况下:

  • YOLOv8m 640x640: 130到145 FPS,人物、车辆、工具检测稳如磐石
  • YOLOv8s Pose: 90 FPS,在昏暗车库里也能工作的完整骨骼追踪
  • CLIP ViT-B/32嵌入: 每秒约400张图像,用于本地语义搜索你自己的照片
  • 使用ArcFace的人脸识别: 针对5000张本地人脸的图库搜索,耗时低于40毫秒
  • 车牌检测加模糊: 720p实时处理,还有余量

因为是本地的,我可以零API代价地串联模型。检测人物、裁剪、运行姿态、运行人脸模糊、运行动作分类。在云端,这将是四次计费调用和额外一秒的延迟。在本地,它只是一个帧管道,硬件成本之外无需额外花费。

对我来说,杀手级应用不是任何一个单独的模型,而是可组合性。我构建了一个用于硬件巡检的模式。它检测电子设备,用一个小型OCR模型读取芯片标记,从本地离线数据库中查找引脚定义,并叠加显示信息。全部离线。如果我想戏剧化一点,甚至可以在法拉第袋里操作。

试试用GPT-4V做同样的事,而你的数据不会进入训练集。

如果你的摄像头画面真的离开了你的房子,那你不是偏执

这是人们不想明说的部分。如果你的安防摄像头、婴儿监视器、工作间摄像头或侦察工具需要互联网才能理解它看到的东西,那它就不是你的工具。你是产品,也是数据源。

将推理移到本地不仅仅是一个性能技巧。这是一个隐私边界。没有遥测。没有你需要信任的保留策略。没有“我们可能会使用你的输入来改进我们的模型”这样的条款埋在第四十七条。

当我切换到本地时,我还锁定了整个设备。没有泄露主机名的mDNS,没有Avahi,启动时随机化MAC地址用于现场工作,加密的NVMe分区用于存储模型和捕获内容,默认导出时剥离元数据。这听起来有些过度,直到你意识到你的手持设备现在存有数小时的私人空间视频。

这个栈最终让我的离线设置变得无懈可击。隐私/操作安全栈涵盖了Nukepack、Ghost Mode、OSINT Pivots、元数据处理以及AI原生OSINT工作流。我现在构建的每个赛博甲板上都使用了Ghost Mode启动配置文件和其中的元数据剥离脚本。如果你要停止为推理付费,拥有自己的算力,那你不妨也拥有自己的足迹。

你应该构建这个吗

如果你喜欢按token付费,并且认为延迟很迷人,那就不必了。

如果你想要一个能在飞机上、地下室里、树林中、另一个国家、抗议现场、没有访客WiFi的客户现场工作的设备,那就构建它吧。

你在一个周末里与PCIe通道配置和模型量化搏斗中学到的关于真实AI部署的知识,会比调用一个月的API学到的更多。你最终会得到一个不在乎OpenAI是否宕机、你的账户是否被标记、或者供应商是否决定你的用例不再被允许的工具。

云非常适合训练大型模型。但对于日常使用来说,它很糟糕。

我的手持设备现在放在包里,挨着我的Flipper和笔记本。它11秒启动。它不要求我登录。它不给我看广告。它只是看着。

我把一个Hailo 8装进了手持设备,停止了为推理付费。你可以留着你的API密钥。我会留着我的TOPS。


原文:https://dev.to/numbpill3d/i-put-a-hailo-8-in-a-handheld-and-stopped-paying-for-inference-3ih7

——

🧑‍💻

zhirenhun

一个热爱技术的程序员,喜欢分享前沿AI知识和开发经验。

AI 边缘计算 Hailo 硬件教程 离线推理
← 上一篇
事后剖析:使用Ollama和ChromaDB构建代码库记忆的本地MCP服务器
下一篇 →
将 Gemma-4(2B / 4B / 12B)移植到 AWS Inferentia2

📌 相关推荐

GraphRAG 是推理问题,而非数据库问题
2026/8/30
构建市场时光机:使用 Python 和 WebSocket 重放交易会话
2026/8/30
如何自行基准测试LLM推理:值得信赖的数字设计标准
2026/8/30
← 返回文章列表