Show HN: Sipp – 在浏览器中将小型本地LLM运行速度提升3倍
Sipp 是一个开源AI推理库,专为在浏览器中运行本地模型而设计,解码速度比同类库快3倍。它基于Rust和C++构建,提供统一的客户端API,无缝衔接本地和云端推理。开发者只需更改端点,即可在浏览器(通过WebGPU)、自托管网关或云服务之间切换,实现从轻量任务到复杂推理的灵活扩展。该库还在内存管理和内核融合方面进行了深度优化,旨在将本地推理性能推向消费级硬件的理论极限。
背景速读
- Sipp 是一个开源 AI 推理库,专门针对在浏览器中运行小规模本地大语言模型(LLM)做了深度优化,宣称解码速度比同类库快 3 倍。代码和在线演示均可在官网获取。
- 当前在浏览器中跑 AI 模型的主要痛点是:WebGPU 支持不完善、模型加载和缓存效率低、性能不足以支撑实时交互。Sipp 的团队此前向 llama.cpp(最流行的本地 LLM 运行框架)贡献了 WebGPU 后端代码,以此为基础从头构建了 Sipp。
- Sipp 的核心设计理念是"统一客户端 API":开发者可以用同一套代码先在浏览器里跑一个小模型,后续只需切换 endpoint,就能无缝升级到本地 CUDA/Vulkan/Metal 或者云端 API。这种"本地小模型 + 云端大模型"的混合模式正是当前 AI 应用开发的热门方向。
- 团队背景是 HCI(人机交互)和图形编程。他们的更长线愿景不是再做一款聊天应用,而是探索当 token 成本趋近于零时,AI 如何成为"无声的手"——持续、间接地感知用户意图,动态生成或调整 UI,而非等待用户主动发起对话。