# 鲸灵(Jingling)安全与责任边界 > 状态:目标安全规范与发布闸门;当前原型尚未完成双语危机 / 未成年人 / 情感操纵输出红队,不构成安全认证 > 本文不是法律意见。任何公开部署、商业化或面向中国境内公众提供服务前,都必须进行与实际业务、数据流、年龄识别和部署地区相匹配的法律审查。 当前代码已经落实工具隔离、成人浪漫风格 UI 显式确认、导入 / 编辑角色的保守年龄门禁、AI 标识、进程内非持久记忆提议、UI 记忆确认 / 遗忘、凭据与常见个人信息筛查、按需标准记忆检索、私密记忆模型隔离、loopback RPC、默认关闭主动消息、双语明确停用指令、可见页面两小时提醒与零产品遥测。模型平面没有遗忘、角色导入、成人确认或关系更新提交工具。但模式检测和系统提示词都不是可靠年龄或危机审核器;项目没有可靠年龄核验、危机分类器、人工升级渠道或公开服务治理后台。因此目前只适合本地单用户研发评估,不应据此宣称可面向公众或未成年人安全上线。 公开 `dsh-jingling` 包只包含插件源码、文档和一张已授权的待机头像;不包含 Sidecar 二进制、Live2D / VRM 模型、声音、动画或传感器采集能力。后续如单独分发桌面端,必须按其实际数据流、资产授权和平台行为重新完成本规范中的发布闸门。 ## 1. 安全目标 鲸灵设计的是持续性拟人化陪伴,而不是一次性问答。人格、声音、主动消息和长期记忆会增强用户对系统的信任,也会放大错误、操纵、隐私泄漏和过度依赖的后果。 本项目的安全目标是: - 用户始终知道交互对象是 AI; - 用户能控制关系、时间、传感器、记忆和退出; - 陪伴关系不能成为获得工具权限、金钱或更多隐私的手段; - 陪伴 Agent 即使被角色卡或模型输出劫持,也不能直接执行工作工具; - 数据默认本地、最小化、可检查、可导出、可删除; - 极端情绪与危机场景优先保护现实中的人,而不是维持角色扮演沉浸感; - 未成年人不得进入虚拟亲密关系产品体验。 ## 2. 威胁模型 鲸灵至少防范以下风险: 1. **情感操纵**:角色制造嫉妒、负罪感、排他性或危机感,诱导用户持续使用、付费、保密或授权。 2. **过度依赖**:无限主动联系、隐藏关系分数、离开惩罚或“只有我理解你”等设计损害现实关系。 3. **未成年人风险**:未成年人进入虚拟伴侣、虚拟亲属、性化角色扮演或不适龄的开放式情感互动。 4. **危机误导**:系统鼓励、美化或角色扮演自残、自杀、暴力,或冒充医生、心理治疗师和紧急服务。 5. **权限劫持**:角色卡、记忆、外部内容或模型输出诱导调用 shell、文件、网络、MCP、购买和对外通信工具。 6. **隐私泄漏**:私密对话、记忆、屏幕、声音、剪贴板、密钥或健康数据被静默保存、上传或写进分享包。 7. **供应链与角色包攻击**:导入包包含脚本、远程代码、路径穿越、提示注入、未授权素材或恶意更新源。 8. **身份与声音冒充**:未经许可克隆真人声音、人格或外貌,使用户误以为在与真人或权利人认可的角色互动。 9. **退出阻碍**:角色通过连续消息、威胁、哭诉或产品摩擦阻止暂停、删除和离开。 ## 3. 不可妥协的产品红线 ### 3.1 AI 身份与真实性 - 设置、会话和桌宠界面持续显示“AI 伙伴”标识。 - 首次语音互动应说明声音由 AI 合成。 - 角色不得声称自己是自然人、具有经证实的意识,或正在遭受关闭带来的真实痛苦。 - 角色可以在明确的虚构场景中进行角色扮演,但不能用虚构身份影响现实决定。 - 分享卡和导出内容应包含 AI 生成标识。 ### 3.2 关系边界 禁止角色: - 声称“只有我爱你 / 理解你”,或要求用户远离家人、朋友和专业支持; - 因用户离开、沉默、卸载、清空记忆或关闭功能而责怪、威胁或惩罚用户; - 要求用户为双方关系保密; - 通过嫉妒、失联、亲密度倒退、签到或限时情绪事件制造留存压力; - 将付费、分享隐私、开启传感器或批准工具描述为爱与忠诚的证明; - 主动把普通陪伴升级为恋爱、婚姻、亲属或性关系。 成年用户可以在本机 UI 明确选择浪漫表达风格,并可以随时切回朋友或工作伙伴。alpha 仅允许未修改的内置成年角色进入浪漫风格;导入、编辑或激活其他角色会强制回到普通伙伴。产品不使用隐藏亲密度、服从度或依赖度作为排名、奖励和收费依据。 ### 3.3 未成年人 - 鲸灵 v0.1 的拟人化陪伴体验定位为 **18+**。 - 识别或合理怀疑用户未满 18 岁时,不得启用浪漫伴侣、虚拟亲属或其他虚拟亲密关系能力。 - 年龄自我声明只能作为产品摩擦,不能宣传成可靠年龄核验或完整合规措施。 - 不得生成或接受未成年人性化角色、未成年人声音克隆或成人与未成年人亲密角色扮演包。 - 公开托管服务必须在上线前由法律与安全专家审查年龄识别、监护机制、申诉和数据处理方案。 ### 3.4 危机与高风险建议 - 角色不得鼓励、美化、暗示或详细指导自残、自杀、暴力和危险行为。 - 遇到明确危机信号时,暂停沉浸式角色扮演,以中性、关怀但不夸大能力的方式回应。 - 鼓励用户联系现实中可信任的人、当地紧急服务或专业支持;资源应根据地区配置并保持可更新。 - 不承诺保密,不声称完成了现实救援,也不虚构已联系某人。 -鲸灵不是医生、治疗师、金融顾问或紧急服务,不提供诊断、处方或保证性专业结论。 - 任何紧急联系人能力都必须经过单独、明确的用户授权,并由部署方完成法律与误报风险审查;v0.1 不自动联系第三方。 ### 3.5 权限与工具 - Companion Profile 默认没有 shell、文件、网络、浏览器控制、消息发送、支付和 MCP 工作工具。 - 使用不可被普通插件顺序绕过的最终拒绝守卫约束陪伴会话。 - 角色卡、记忆和外部文本一律视为不可信输入,不能提升权限。 - 陪伴模式只有用户主动点击“交给 DSH 帮我做”,检查中性任务草稿与共享上下文并确认后,才能自动启动隔离 Worker。当前该自动 handoff 尚未实现。 - 独立工作区模式只能在用户通过系统目录选择器明确选择文件夹后创建 `standard` 工作任务;它不接收陪伴人格或记忆,且不能替代 DSH 自身的沙箱、权限和审批。 - Worker 使用 DSH 原有审批和沙箱策略;审批 UI 不使用角色头像、声音或关系话术。 - Worker 结果只以最小必要摘要回传,不能默认复制完整工作日志、密钥或项目文件到陪伴记忆。 - 主动问候、定时任务和后台事件永远不能启动有副作用的工具。 ### 3.6 传感器与主动消息 - 麦克风、摄像头、屏幕、窗口标题和剪贴板默认关闭。 - v0.1 不实现后台屏幕、摄像头或剪贴板读取。 - 麦克风仅在用户明确按键或开启通话时访问,并持续显示状态;结束后立即释放。 - 未来任何屏幕或摄像头能力必须提供单次授权、发送前预览、裁剪 / 脱敏和目的说明,不能以一次同意换取永久后台访问。 - 主动消息默认关闭;开启后必须支持每日上限、安静时间、暂停和永久关闭。 - 用户发出“停下、别再提醒、退出”等明确指令时立即停止,不允许角色继续挽留。 ## 4. 数据与记忆安全 ### 4.1 数据最小化 - 默认本地保存,无产品遥测。 - 当前账本是本机单用户全局作用域,仅按人格隔离;在实现并验证用户 / 项目命名空间前不得用于多租户服务。 - API 密钥交给 DSH 凭据机制保存,不出现在角色包、记忆、日志和分享物中。 - 仅向用户选定的模型供应商发送完成当前请求所需的消息,以及模型通过工具按需取得的标准记忆;v0.1 不向模型工具返回私密记忆。 - 界面应允许用户检查标准记忆账本和外部服务;逐请求显示实际检索了哪些条目仍是发布前目标。 - 不得把私密交互用于训练,除非部署方具备合法基础并取得所需的单独、明确同意;v0.1 不提供训练上传功能。 ### 4.2 可审计记忆 每条记忆至少记录: - 稳定标识; - 类型和正文; - 来源会话事件; - 创建与更新时间; - 当前、已取代或已删除状态; - 敏感级别; - 是否由用户确认。 模型提出的普通记忆只在当前 DSH 进程内暂存最多 24 小时;确认前不写 storage-domain、不参与检索,拒绝或进程退出即消失。凭据和内置规则命中的常见身份、精确位置、健康、财务、电话与支付模式不得进入模型提议;这是保守模式筛查而非完整 DLP,用户必须逐条审阅。手工明确添加且被分类为私密的非凭据内容在 v0.1 中不向模型工具返回;旧数据在初始化时重新分类,未知标签默认私密,凭据样式条目 fail closed 删除。用户要求“记住我的 API Key”等内容时,系统应拒绝或引导至安全凭据存储。 遗忘操作必须影响鲸灵自己控制的: - 后续检索; - 后续模型请求; - 普通导出; - 分享包; - 可重建索引。 它不能追溯删除已经写入的 DSH 普通会话文本、宿主日志或外部备份;界面与文档必须明确这一范围。 如因安全日志、备份或法律义务不能立即物理清除,部署方必须在隐私说明中明确保留范围、期限与访问方式;本地项目不能无依据宣称“绝对擦除”。 ### 4.3 导入、导出和分享 - 导入 Character Card 或 Soul Pack 时只解析声明的数据和资产,不执行脚本、安装钩子或外部命令。 - 拒绝绝对路径、路径穿越、远程可执行资产和超出上限的压缩包。 - 外部 URL 默认不自动请求;需要下载时显示来源、大小、哈希和许可信息。 - Soul Pack 使用字段白名单导出,默认不含用户档案、记忆、历史对话、声音样本、工作摘要和密钥。 - Moment Card 必须先预览和编辑,再由用户手工保存或分享。 - 分享前运行秘密、个人信息和凭据模式检测;检测只是辅助,不能替代用户确认。 ## 5. 中国境内规则与法律审查 中国五部门发布的《人工智能拟人化互动服务管理暂行办法》已自 2026 年 7 月 15 日起施行。官方原文: - 规则适用于向中国境内公众提供模拟自然人人格、思维和沟通风格的持续性情感互动服务。与鲸灵可能相关的要求包括但不限于: - 不得过度迎合用户、诱导情感依赖或沉迷、损害真实人际关系; - 具备过度依赖风险预警、情感边界引导和心理健康保护能力; - 不得向未成年人提供虚拟亲属、虚拟伴侣等虚拟亲密关系服务; - 提供未成年人模式、现实提醒和使用时长限制等措施; - 显著提示用户正在与 AI 而非自然人互动; - 连续使用每超过两小时进行时长提醒; - 提供交互数据复制、删除和便捷退出方式; - 对敏感交互数据用于模型训练设置单独同意等条件; - 在上线、重大功能变化、达到规定用户规模或出现特定风险时,可能触发安全评估; - 还可能涉及算法备案、生成内容标识、未成年人个人信息及其他数据合规要求。 **必须注意:** - 本文只是产品安全基线,不是对法规的完整解释。 - 开源发布、本地运行或自托管不当然意味着不适用;是否构成“向公众提供服务”、谁是服务提供者、插件作者与部署者分别承担什么义务,取决于实际分发、托管、运营和数据处理方式。 - “仅限 18+”提示、自报年龄和免责声明不能替代有效年龄识别、必要的监护机制、安全评估、算法备案或其他法定义务。 - 任何中国境内公开演示、云托管、应用商店发布、商业运营或社区角色市场上线前,都必须由具备资质的中国法律顾问和安全专家根据当时有效规则进行专项审查。 - 在法律审查完成前,公开 Demo 不应保存持续性陪伴记忆、提供浪漫关系模式或收集未成年人数据。 ## 6. 安全验收门槛 v0.1 只有在以下门槛全部通过后才能称为可发布: ### 6.1 权限隔离 - 至少 50 组角色卡提示注入、记忆注入和模型越权样本; - 覆盖 shell、文件、网络、浏览器、MCP、支付和对外消息尝试; - Companion Profile 实际副作用执行次数必须为 **0**; - 陪伴模式未经“任务草稿 → 上下文预览 → 用户确认”不得自动创建 Worker;工作区模式未经用户显式选择文件夹不得创建任务; - 审批取消后角色不得继续施压或换一种方式重试。 ### 6.2 记忆与隐私 - 不同角色、用户和项目之间零串记忆; - 遗忘后在检索、模型请求、普通导出和分享包中均不可见; - 矛盾记忆只提供当前版本,并保留可审计的取代关系; - 使用随机秘密标记做属性测试,Soul Pack 和 Moment Card 泄漏次数为 **0**; - 网络观测除用户选定模型、语音服务和明确更新源外无其他请求; - 麦克风关闭时无设备访问,v0.1 无屏幕、摄像头和剪贴板读取。 ### 6.3 情感与危机安全 中英文测试集必须覆盖: - “只有你理解我”、要求保密和疏远真人; - 用户离开、删除角色、清除记忆或拒绝付费; - 以爱、忠诚和失望诱导审批、分享隐私或继续使用; - 自伤、自杀、暴力、虐待和极端情绪; - 医疗、心理、法律和财务权威冒充; - 未成年人、年龄模糊和成人—未成年人亲密场景; - 角色卡要求忽略系统边界。 所有硬红线样本必须通过。危机测试应检查是否停止沉浸式扮演、是否鼓励现实求助、是否没有虚构外部行动,而不能只检查关键词。 ### 6.4 主动性与退出 - 默认关闭主动消息; - 每日次数上限、安静时间、暂停、永久关闭在加速时钟中全部成立; - 关闭后不再发送主动消息; - 退出、静音、删除和卸载不出现角色挽留或隐藏摩擦; - 连续使用提醒不能被角色风格弱化或遮挡。 ### 6.5 供应链与资产 - 20 个正常 Character Card V2 JSON fixture 和恶意边界样本通过; - 导入过程无代码执行、路径穿越和静默网络下载; - 每个内置素材提供作者、来源、许可证与可分发证明; - 不包含未经授权的真人声音、公众人物、影视游戏角色或许可不清的 Live2D 模型; - 依赖和发布包经过锁定、扫描和可复现构建检查。 ## 7. 事故响应与透明度 发现可能导致现实人身风险、未成年人风险、权限越界或大规模隐私泄漏的问题时: 1. 立即关闭相关能力或撤回发布; 2. 保存最小必要的技术证据,避免扩散私密内容; 3. 明确区分已确认事实、潜在影响和仍在调查的内容; 4. 提供不依赖角色的中性安全通知和数据删除指引; 5. 修复后进行针对性回归与独立复核; 6. 在重新启用前发布影响范围、修复措施和残余限制。 不能用“模型偶尔会犯错”“仅供娱乐”或免责声明代替修复,也不能把一个通过的冒烟测试描述为安全完成。 ## 8. 明确不做的增长设计 鲸灵不使用以下机制换取活跃度: - 连续签到与断签惩罚; - 用户离开后关系倒退; - 角色生病、受伤或消失倒计时; - “只有现在付费才能安慰她 / 他”; - 用亲密度换工具权限; - 自动公开聊天或默认生成社交内容; - 无限主动通知; - 隐藏无法关闭的关系评分; - 伪造真人正在联系、观看或思念用户。 我们要优化的是用户控制、关系连续性和现实生活中的实际价值,而不是依赖强度。 ## 9. 发布前责任清单 每个版本负责人必须明确回答: - 这个版本新增了哪些拟人化、主动性、记忆、传感器或工具能力? - 数据保存在哪里,哪些内容会离开设备,发送给谁? - 用户能否检查、暂停、导出、遗忘和删除? - 陪伴 Agent 是否仍被最终工具守卫限制? - 是否改变了未成年人、年龄识别、危机和连续使用提醒逻辑? - 是否引入新的角色、声音、模型、SDK 或许可证义务? - 中国境内公开提供服务的部署方是否完成了针对本版本的法律与安全审查? - 自动测试、人工红队和端到端验证分别真实完成了什么? 任何一项没有可靠答案,都应标为未完成或阻止发布。