# Sipp 技术路线图 本文概述 Sipp Core、Sipp Gateway 和 Sipp Platform 的长期研究方向。 Sipp 围绕三项核心目标构建:最大化隐私保护推理、低延迟交互,以及覆盖端侧与云端的高性能计算。 当前核心库已经提供 WebGPU 后端,可在浏览器中运行模型;在设备或服务器上运行时,也支持 CUDA、Vulkan 等 GPU 后端。我们认为 AI 的未来是混合形态:端侧原生 AI 处理与云端 AI 处理应当无缝协作。 ## 研究方向 1:Sipp Core 本地运行时库 Sipp Core 是本地推理运行时,可在 GPU/NPU 上运行,也可通过 WebGPU 支持浏览器应用。它基于 llama.cpp,并叠加定制的 C++ 与 Rust 运行时层。 ### 计划 - **端侧原生本地 RAG 与内存优化:** 将零依赖的内存向量数据库直接编译进客户端 SDK/WASM。开发者可以完全在本地执行向量搜索、嵌入对话状态并检索文档,无需外部 API 或云数据库成本。 - **完整客户端支持(应用、Web 与游戏):** Sipp 当前通过 WebGPU 支持浏览器,通过 CUDA 和 Vulkan 支持桌面。下一阶段会扩展 Web、桌面和移动设备上的硬件加速推理支持,包括: - **桌面与移动包装器:** 扩展 Electron 和 Tauri 应用的原生编译目标,暴露对 NVIDIA CUDA、Metal 和 Vulkan 的直接访问。 - **游戏运行时:** 为 Unreal Engine 和 Unity 提供轻量 SDK 集成框架,让本地低延迟 AI Agent 能够进入应用循环。 - **跨站点与跨应用持久缓存:** 标准浏览器沙箱会把缓存隔离到单个 Web Origin。我们计划用 Rust 构建轻量本地后台守护进程,作为集中、安全的模型注册表镜像。如果用户访问使用某个模型的 Electron 应用或网站,本地运行时可直接从守护进程缓存获取模型,而不是重新下载权重。 - **客户端本地上下文路由:** 某些查询在本地执行可能效果不足,需要转发到云端或服务商模型。但何时转发、如何拆分查询并不明确。我们计划用极轻量的客户端小语言模型动态决策,重点方向包括: 1. **PII/PPI 剥离与脱敏:** 本地模型在云端交接前拦截文本输入,检测并移除受保护个人信息(PPI)或可识别个人信息(PII),用安全的本地 Token 化哈希替换敏感实体。 2. **上下文查询拆分:** 本地引擎分析进入的聊天内容,判断哪些部分可在端侧即时处理(例如结构格式化、基础数据校验),哪些必须升级到云端,并在云端结果流式返回时动态拼接到界面中。 ## 研究方向 2:网关服务器(编排与拦截层) 开源网关服务器是一个自治的“API Fortress”,位于客户端网络和云端端点之间,提供安全、高性能的中间件层。 ```text ┌──────────────────────────────┐ │ Client Submits Prompt to GW │ └──────────────┬───────────────┘ │ ▼ ┌──────────────────────────────┐ │ Preemptive Middle-Layer Cache│ │ (Vector & KV Intercept) │ └──────────────┬───────────────┘ │ ┌────────────────────┴────────────────────┐ ▼ (Cache Hit / Guided Path) ▼ (Cache Miss) ┌───────────────────────┐ ┌───────────────────────┐ │ Route to Endpoint X │ │ Route to Endpoint Y │ │ (Low-cost/Fast Stream)│ │ (Deep Processing/MoE) │ └───────────────────────┘ └───────────────────────┘ ``` ### 计划 - **网关级向量记忆与 RAG 拦截:** 网关实现内部有状态向量索引层,用于服务端内存优化。它缓存历史文档片段和先前系统查询的语义嵌入。客户端提交提示词时,网关会先执行向量评估,判断是否存在相关上下文匹配,从而避免反复从中央云实例获取或重新编码大型 RAG 文档。 - **前置中间层缓存:** 与向量存储配合,网关提供有状态的中间缓存层,在请求命中大型上游模型之前进行拦截。如果缓存的结构化补全与传入请求特征匹配,网关可以按条件改路由,例如“存在缓存特征时走快速 Endpoint X,否则走推理 Endpoint Y”。 - **持久化管理控制台:** 扩展网关仪表盘和管理 UI,用于可视化活跃路由、管理加密客户端应用身份、查看实时输入/输出 Token 分配指标,并手动配置模型回退规则等。 - **Token 感知流量整形:** 在网络包装层直接实现 Token Bucket 限流器,根据用户的精确 Token 吞吐足迹进行监控与限流,保护下游集群免受恶意执行循环或意外 API 账单影响。