本地跑 AI,安全得全归你了:一份落地清单

本地 AI 模型运行

一想到”本地 AI”,很多人默认它比把数据喂给云端服务更安全、更私密。只对了一半。本地跑,你的消息、文档、聊天记录确实不出这台机器,你可以自己定数据给不给付第三方,也省得担心下一轮科技巨头的数据泄露把你的凭据带出去。但另一方面,你把 OpenAI、Anthropic 那些花了数百万建起来的安全基础设施,拒之门外了。安全这块,从此全归你,好坏都算你的。

以下是在自己电脑或私有 VPS 上跑模型时,实际能用上的十条。

本地跑,到底安不安全?

用 Jan、Ollama、LM Studio 这类平台在自己硬件上跑模型,你的消息、文档、聊天记录不出设备,也不发去别家的云服务器。担心 AI 公司在你没同意时卖数据,或者担心自己的凭据又上下一轮泄露名单,本地确实是对的方向。

Ollama 与本地推理

但远没”本地”两个字稳当。模型文件还得从公共库下载;模型可能得访问某些 API,让它通过公网跟你软件或数据对话;要是你在公共 Wi-Fi 上,同一网络上的人可能瞄着你的 AI 打主机系统的主意。别把”本地”当成一句能偷懒的口号。

就今年一月,SentinelOne 和 Censys 扫出 17.5 万个暴露到公网的 Ollama 主机,任何一个有网线的攻击者都能借它们执行代码、套取用户凭据。真要本地跑,得在”模型从哪来”和”能碰什么”两件事上较真。

模型服务器留本地环

跑本地模型得靠推理引擎(runner),像 Ollama、LM Studio,让模型在你的硬件上加载执行。默认这些 runner 绑在 localhost(127.0.0.1 或 ::1),意思是同网段或公网都够不着。但你要是把监听改到 0.0.0.0,就等于对全网络开放,同网段任何设备都能拉起你的本地 AI 来改你的硬件或偷你的数据。

有些教程为图方便会让你这么做,从手机或别的设备访问本地模型,或者在 VPS、NAS 上跑模型。这会把数据和流程暴露出去。真改了默认配置,现在改回来:

  • Ollama:把 OLLAMA_HOST 变量改回 127.0.0.1。
  • LM Studio:关掉”在本地网络上提供(Serve on Local Network)”。
  • Jan:进 Hub 界面的齿轮进设置页,选本地 API 服务器,用在线生成器起一个 API 密钥。

远程访问走 VPN 隧道,别开端口转发

不该把你的 AI 模型暴露到公网 IP。但你要是真想远程分享模型访问呢?很多人第一反应是在路由器上开端口转发。对本地机器上的 AI 模型或 runner 来说,这条路别走。

如果模型已经跑在 0.0.0.0,你又在路由器上开了端口转发,攻击者只要猜中你的 IP 就能进来。僵尸网络平时就在扫描家庭 IP 的开放端口,这么做等于把自己排进扫描名单。更好的做法是搭一条加密隧道,用 VPN 或 Cloudflare ZTNA。像 Tailscale 这类 mesh VPN 就是为这场景设计的,Cloudflare Zero Trust 的 Tunnel 也是。

补丁一到就更新 runner

2026 年 5 月,Cyera 挖出 Ollama 一个新漏洞,用未认证 API 调用就能拿走数据块和凭据。这个叫”Bleeding Llama”的漏洞,CVSS 9.3。打补丁前,大约有 30 万个暴露的 Ollama 服务器处在风险里,补丁版本是 0.17.1。

LM Studio、Ollama、Jan、GPT4All 这些 runner 都还偏实验性质,经常冒出在新版本才修掉的漏洞。runner 落后哪怕一两个版本,都可能开着能被攻击者利用的口子。一有新版,就去 runner 官网或 GitHub 仓库拉最新的。

选 safetensors 或 GGUF,别用 pickle

基于老深度学习栈(PyTorch)的模型常以 pickle 格式发,扩展名 .bin、.pt、.pkl。Python pickle 的机制决定了,这类文件可以在你的 runner 一加载就执行里头的恶意代码。

2025 年,ReversingLabs 在 Hugging Face 上找到两个真实流通的模型文件,居然躲过了平台的自动安全检查,里头藏着未授权的远程访问功能。现在 Hugging Face 自家文档也把 pickle 文件列为重大安全风险。

想避开泄露和未授权访问,只下 .safetensor 或 .gguf 这类新格式。它们把数据按数值存,加载时不可能执行恶意代码。某个模型只有 .pt 或 .pkl,那直接跳过去,新版 LLM 里用安全格式的够多。

从能核验的发布者那下模型

Hugging Face、ModelScope 这类 AI 库,任何有网的人都能传模型上去。平台有安全协议,但像 2025 年 ReversingLabs 发现的那种更精细的漏洞,能绕过去。

更稳的做法:只从大模型开发方的官方账号下。Google、Mistral、Meta、Qwen(阿里)在 Hugging Face 上各有带认证标的组织账号。认证标说明这个公司账号确实归那家公司管,因为上传者得用官方企业邮箱登录传文件。想看细节,翻 Hugging Face 文档的 Advanced Security 一节。

AI 工具只从官方渠道拿

攻击者喜欢拿热门 GenAI 工具当诱饵,骗人装恶意软件。常见手法是搭个假网站,或者往应用市场里传一个假扮官方的,诱你下损坏的 .exe 或 .dmg,然后投 Redline、Lumma、Mac 上的 Odyssey infostealer。Play Store 里针对 Android 用户的同类攻击也有。

但这类攻击现在更精了,甚至瞄准冷门本地 AI 平台和 Python 包。攻击者会去攻破官方 GitHub 仓库和 PyPI 上传。TrendAI 报过一例:恶意代码被直接塞进 LiteLLM 的官方 PyPI 包里,那个开源 AI 网关本来让你用一个 API 调几百个 LLM。Positive Security 也在 PyPI 上发现了假扮 DeepSeek 的恶意包。

确认你的工具从哪来的。最稳的,是官方直接来源、可信赖的 AI 厂商维护的认证 GitHub 仓库,以及官方文档里直接引用的 Python 包。

模型让你装的包,双验一遍

Python 包被拿来一运行就塞恶意软件这事上面说过了。要盯的还不止 LLM 文件和 AI 工具。你让 AI agent 写代码、跑任务时,它也会顺手装并执行完任务所需的包和依赖。而 AI 模型天生会”幻想”出根本不存在的包名。有篇研究扫了 16 个模型、57.6 万份代码样本,开权重 LLM 有 21.7% 概率造出不存在的包名,前沿模型低一些,5.2%。

攻击者懂这个,搞出所谓”slopsquatting”:抢先把这些模型高频幻化出来的包名注册成假包。你 agent 一运行,恶意代码、提示注入、信息窃取器就跟着跑了。

避开这类攻击,最实际的是限制 agent 能装的包:要么每个包装之前手动批准,要么把可信仓库列进白名单。无论哪种,回头翻模型的日志,看它跑了哪些 pip install 和 npm install,别放过没授权的安装。

收紧 agent 能碰的东西

即便在你本地硬件上跑,AI agent 也能调 MCP 服务器、下载并运行文件、搜网、用 API 连第三方服务,甚至读写你本地文件、改核心系统设置。这些能力要按你的安全水位,开得很克制。新开的、更易幻化出漏洞的开权重模型尤其要管好权限。

管 agent 权限有几条路:把 AI 流程跑在一个碰不到系统文件的 Docker 容器里;或者改 agent 框架的默认配置来限权限,比如 OpenClaw 或 Hermes。OpenClaw 提供 ask、deny、allowlist 三种默认权限档,还能缩到特定流程或服务;Hermes 也能设白名单,或按 cron 任务限制工具使用。

开 local-only 模式

Ollama、LM Studio 这些 runner 既能跑本地模型也能跑云端的。你没在 Hermes 或 OpenClaw 编排层禁网,也能在 runner 这一层单独把网络访问锁死:把服务绑到本地 IP(127.0.0.1),别的设备就够不着。

加密存聊天记录那块盘

你本地留着 AI 流程,聊天记录、共享给模型的凭据、密钥、API token,全是以明文躺在本地盘上的。谁能物理拿到这台设备,全拿走。FileVault、BitLocker、LUKS 能把整个盘加密,没密钥就解不开这些明文。设备丢了或被盗时,这层是最后挡一下的。

起步平台

如果是刚进本地 AI,下面几个对用户友好度最好:

  • Ollama:macOS、Windows、Linux 都跑的开源 runner,模型库大,桌面应用简单,很多本地 AI 工具能直接接。
  • LM Studio:打磨过的桌面应用,能在图界面里从 Hugging Face 拉模型。2025 年 7 月起个人和企业使用都免费。
  • Jan:开源、Apache 2.0 协议的 ChatGPT 替代,Windows/macOS/Linux 全程离线跑。
  • AnythingLLM Desktop:MIT 协议的免费应用,拿你自己的文档本地聊天,喂 PDF 和笔记不用上云。
  • Open WebUI:浏览器端的离线聊天界面,能接 Ollama,配上 mesh VPN,全家能共用一台 AI 服务器而不出安全线。