人工智能的发展历史可以追溯到二十世纪五十年代。1956年，达特茅斯会议上，一群科学家首次正式提出了"人工智能"这个概念，标志着这一学科的诞生。

早期的人工智能研究主要集中在符号推理和专家系统上。研究者们试图通过编写规则，让计算机模拟人类的逻辑推理过程。这种方法在一些特定领域取得了成功，但也暴露出局限性：规则难以覆盖现实世界的复杂性。

进入二十一世纪后，随着计算能力的提升和大数据的积累，机器学习尤其是深度学习技术迅速崛起。深度神经网络通过大量数据自动学习特征，不再依赖人工设计规则，这让人工智能在图像识别、语音识别、自然语言处理等领域取得了突破性进展。

近年来，以Transformer架构为基础的大语言模型进一步推动了人工智能的发展。这类模型通过在海量文本上进行预训练，学习到了丰富的语言知识和世界知识，能够完成对话、写作、翻译、编程等多种任务。

不过，人工智能技术的发展也带来了一系列值得关注的问题，包括数据隐私、算法偏见、就业结构变化以及如何确保人工智能系统的安全性和可控性等。这些问题需要技术界、学术界和政策制定者共同努力来解决。



你需要知道的 AI 三种机制
这是"AI 小知识系列"的第三篇，前两篇分别是《大模型需要多少内存》和《AI 缓存是什么》。

我分享一些自己的学习笔记，用来理清对于 AI 技术的理解。我尽量写得通俗，希望对大家有用。



今天谈一个基本问题：AI 为什么能够回答我们的提问，它怎么会知道答案？

你可以找到很多这方面的论文和书籍，详细解释大模型的运作，通常非常难懂。但是，对于非专业人士，只要简单知道 AI 的三个机制，就可以了。

（1）参数机制

在宏观层面，所有大模型都是对人类知识的建模。它建立了一个数学模型，用来描述所有的人类知识。

怎么描述呢？它使用的是一种参数机制，将知识分解成一个个"词元"（token），然后计算所有词元之间的数学关系。这个过程称为"训练"。

这种数学关系使用无数个参数来表示。举例来说，大模型 GLM 5.3 有7440亿个参数，这些参数用来构建所有词元之间的关系（也就是权重）。所谓"训练"，其实就是找出这个7440亿个权重，描述人类知识的构成，也就是所有词元之间的关联。

一旦训练完成，我们向大模型提问时，它就会根据这些权重，找出最可能的词元，从而生成符合概率的答案。

所以，大模型本质上是一种"压缩-生成"机制，将人类知识抽象在无数参数之中，后期再生成出来。

（2）推理机制

不难理解，参数越多，模型的效果越好。因为更多的参数意味着，可以更精确地描述各种知识，从而可以更准确地将其还原出来。

但是，一方面，参数不可能无限增加，训练和使用成本将直线上升，使用时的运算时间也会变长。

另一方面，也没有必要包含所有的知识，很多知识不需要包含在参数之中，完全可以通过逻辑推理获得。

举例来说，只需要知道某个城市的人口出生率和死亡率，就马上知道了人口的净增长率。这不需要记忆，可以通过推理得到。

大模型就依靠推理机制，根据参数包含的知识，从逻辑规则出发，推断出那些它没有包含的知识。

（3）联网机制

不管模型有再多的参数、再强的推理，它不可能包含所有的知识，总有一些问题它回答不了。

比如，你问大模型，今天股票的收盘指数是多少，它就回答不了。参数里面不包含这个知识，也无法推理得到。

这时，模型就要依靠 Agent 或应用框架提供的联网机制，自动去互联网搜索那些它不知道的知识。

（4）总结

正是有了以上三种机制，AI 才能正确回答我们的问题。

首先，参数机制提供了大模型的基本知识；其次，推理机制产生通过推理得到的知识；最后，联网机制用来获取前两种机制都无法得到的知识。


你需要知道的 AI 缓存知识
大模型的价格，主要是 Token 的输入价格和输出价格，这个很容易理解。

但是，还有一项"输入 Token 的缓存命中价格"，这是什么东西？



上图是 DeepSeek V4 Flash 模型的定价，可以看到缓存命中的输入价格只有2分钱，足足是未命中的输入价格的五十分之一！

为什么相差这些大？我们能不能充分利用缓存，来降低费用呢？

我对于这些问题，以前也不是很了解，最近看了一篇文章，终于理清了思路，今天就来分享。

（1）模型输入的收费原因

大家知道，使用大模型的时候，需要先有提示词。

大模型会将提示词分解成 Token，再将 Token 转成向量值，然后计算所有 Token 之间的注意力关系。

这一步非常消耗算力，因此模型公司会对输入 Token 收费。你的提示词越多，输入 Token 的费用就越高。

（2）输入缓存的作用

对于多轮对话和长程任务，每一轮都需要把以前步骤的输入输出结果，提交给模型。

我们可以想到，这些每一轮额外增加的提示词是不变的，以前都已经处理过了。模型完全不必要对这些"前缀"每次进行重复计算，只要把以前的计算结果缓存起来，下一次再取出来用就行了。

这就是为什么需要缓存，它可以大大节省不必要的算力消耗，加快模型处理。

这也是它便宜的原因，因为只要命中缓存，基本不消耗算力，收取的费用实际上是储存空间的费用。

（3）缓存的时间期限

缓存有时间期限，长期保存并无意义。如果一段时间没有用到这些缓存，服务器就会把缓存删除。

根据前面引用文章的测试，各家公司的缓存保存时间不一样。

Anthropic：5分钟
DeepSeek：10分钟
OpenAI：10分钟～30分钟逐步失效
Google：1小时内逐步失效
以 DeepSeek 为例，在10分钟以内，缓存就是有效的，命中缓存只收取2分钱。如果对话的间隔特别久，下一次输入跟上一次之间超过了10分钟，缓存就被删除了，模型收到上一轮的提示词，就不得不重新计算，收取的费用就变成了1元。

（4）保持缓存有效

由于缓存命中与未命中之间，有巨大的价差。用户的 AI Agent 工具往往会想办法，尽可能延长缓存的保存时间。

当用户长时间不操作、也不退出的时候，大多数 AI Agent 会每隔30秒，自动向服务器发送一个请求，让缓存保存激活状态。

有些模型有专门的缓存激活接口，还有一些没有。这时可以用笨办法，Agent 自动重复发送一次以前的提示词，确保缓存激活。

不过，激活请求也会产生费用。每隔30秒发送一次，如果10分钟没有输入，就会发送20个激活请求。时间一长，费用也不低。

前面说过了，现在各家模型的实际缓存期限，最短也有5分钟，因此30秒一次的激活请求，似乎频率太高了。所以，最新的建议是，可以改成每4分钟自动激活一次缓存。



你需要知道的 AI 内存知识
自己在家运行 AI 模型，可以选择两种硬件。

一种是独立显卡，目前最顶级的消费级显卡是英伟达的 RTX 5090，带有 32GB 显存，售价3万元人民币左右。



另一种是采用板载芯片组（CPU + 板载显卡 + 板载内存）的家用电脑，比如采用 AMD 公司 Strix Halo 芯片组（具体型号 Ryzen AI Max+ 395）的迷你电脑，自带 128GB 内存，售价2万元人民币左右。



我问大家，哪种硬件更好？

大部分人可能不假思索，就会选择独立显卡，毕竟独立显卡的算力远大于板载芯片组。

根据我查到的资料，下面是两者的单精度32位浮点数算力（FP32）。

独立显卡（RTX 5090）：104.8 TFLOPS
板载芯片组（AMD Ryzen AI Max+ 395）：14.8 TFLOPS
可以看到，独立显卡的算力，足足是板载芯片组的7倍。如果是更小位数的浮点数计算（比如 FP16 和 FP4），算力差距就更大了。

但是，我告诉你，正确的答案其实是"不确定"。很多时候，板载芯片组的迷你 PC，才是更好的本地 AI 模型解决方案。

原因很简单，大多数的 AI 模型（只要参数规模稍大），RTX 5090 根本运行不了。

问题出在它的 32GB 显存实在太少了。一个 70B 参数的模型，如果每个参数使用4位精度，那么将所有参数的权重读入内存，大约需要 32.6GB 的内存，这超出了 RTX 5090 的显存大小，它根本跑不起来。

相比之下，AMD 迷你电脑的板载内存有 128GB，载入模型毫无困难。板载芯片组的内存是显卡和 CPU 共用的，所以称为"统一内存"。它的好处是可以分出尽可能多的内存给单个处理器，所以能处理内存消耗量很大的 AI 模型。

苹果的 M 系列芯片一直是这种"统一内存"架构，其他厂商现在也跟进了，AMD 的 Strix Halo、NVIDIA 的 DGX Spark、Intel 的 Core Ultra 和高通的 Snapdragon X 都采用这种架构。除了内存容量大，它的价格也比独立显卡低。

读到这里，你可能会问，既然板载芯片组有这些优点，还有必要购买独立显卡吗？

回答是，内存有两个指标，除了容量大小，还有一个指标"内存带宽"。板载芯片组的弱点，恰恰就是内存带宽。

所谓"内存带宽"，指的是内存向处理器传送数据的速度。虽然 RTX 5090 显存不多，但是内存带宽极大，达到了 1792GB/s，而 AMD 的内存带宽只有 256GB/s。

AI 模型每生成一个 Token，需要处理器从内存中读取整个模型，进行计算。如果内存带宽是 256GB/s，那么 40GB 大小的模型，处理器一秒只能读取6次（256除以40），也就是说每秒只能生成6个 Token（这是理论值，实际可能还达不到）。这样的龟速，谁能忍受？

即使是内存带宽最大的苹果 M3 Ultra 芯片，带宽为 819GB/s，每秒可以生成20个 Token，远不如 RTX 5090 的 1792GB/s。

所以，内存大小和内存带宽，两者都是 AI 模型的瓶颈。这也是高带宽内存（HBM）价格涨疯了的原因。

如果你选择板载芯片组的迷你电脑，就要做好心理准备，忍受非常慢的 Token 生成速度。

好在为了节省计算量，出现了"混合专家模型（MoE）"这种架构，它计算 Token 时，不需要读取全部参数，只需要激活一部分参数即可。

以 Qwen3-30B-A3B 模型为例，它包含 30B 个参数，但每次只激活 3B 个参数，因此每个 Token 需要读取的数据量不是 20GB，而是 2GB。那么在 AMD 迷你电脑上，每秒理论上可以生成100多个 Token，这样的速度就相当不错了。

因此，如果你用"统一内存"模式的迷你电脑，就选用 MoE 模型吧。

另外，迷你电脑还有一个很大的缺点，跟内存无关，而跟它的算力慢有关。

我们知道，模型必须先处理用户的提示词，然后才能生成 Token。因为迷你电脑的算力慢，所以它处理提示词也很慢。

根据实际测算，AMD 迷你电脑使用 70B 的模型，提示词处理速度是每秒95个 Token。那么，用户提交4000个 token 的一个文档，大约需要40秒才能处理完，然后才能输出第一个 Token。

可以想象，一旦用户往上下文窗口塞入更多的内容，单单是处理提示词，就会变成几分钟到几十分钟。

总之，现阶段想在本地电脑运行大模型，无论是独立显卡还是板载芯片组，都有缺陷。你最多只能运行一些中等规模的 MoE 模型，而且提示词不能很长。


财富正在向 AI 集中
AI 相关的所有东西，最近都在上涨。

看看股票，就知道了。内存、储存、CPU、服务器、液冷、光通信、变压器......股价全部在涨，更不要提，前期已经涨过的芯片、模型、算力了，甚至铜和铝也在涨。

这些股票的上涨幅度之大，令人咂舌。就以内存为例，世界三大内存厂商有两家在韩国，单单这两家公司就把韩国股市，从2600点一年之内拉到7600点。

2024年10月，三星公司董事长还因为半导体业绩不佳而道歉，结果今年很可能成为世界最赚钱公司。



另一家内存大厂 SK 海力士更夸张。它跟工会有劳资协议，10%的利润要分给员工。有人计算了，门卫、司机、前台都算进去，每个员工今年平均可以拿到奖金610万人民币。



至于 AI 模型公司，更是人人都是亿万富翁。OpenAI 去年向600个员工回购了66亿美元的股票，平均每人拿到近1000万美元。



这些事情表明，社会财富正在重新分配，快速向 AI 集中。

这影响到了所有人。哪怕你根本不使用 AI，但是物价的上涨、资金从本行业流向 AI，不可避免影响到你。

日常使用的电子设备（手机和电脑）、电子元件、基本的生产资料（比如铜和铝）都在涨价。如果你在一个跟 AI 无关的行业，很可能吃不到 AI 的红利，反而被它伤害，因为你会面临成本上升、需求不足、投资减少。

古人说"一将功成万骨枯"，AI 的崛起不知伴随着多少其他行业的陨落。

虽然每一次技术革命，都必然伴随财富的重新分配。但是，这一次的 AI 革命，推进速度格外快，力度格外大，引发的再分配效应也格外猛烈。

作为一个普通人，尤其是身在互联网和软件行业的普通人，似乎也没有其他选择，总是被财富诱惑，只能紧跟潮流拥抱 AI。

别用 AI 估算碳水含量
糖尿病人需要控糖，不仅要少吃糖，还要少吃碳水化合物（米饭和面粉），因为碳水最终也会变为糖。

所以，他需要知道，食物里面含有多少碳水。

很自然的想法就是，吃之前拍一张食物照片，交给 AI 估计碳水含量。



一位英国医生就做了一个实验，把13张食物的照片（比如奶酪三明治、西班牙海鲜饭、焦糖布丁）提交给四个大模型----GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Pro、Gemini 3.1 Pro----估计碳水含量。

结果让人大跌眼镜，四个模型给出的回答不一样。而且，同一张照片多次提交给同一个模型，回答也不一样。

就拿上面这张西班牙海鲜饭的照片为例，分别多次提交给四个模型，模型的估计值如下图。



可以看到，每个模型估计同一张照片的碳水含量，波动范围都很大。其中，波动最大的是 Gemini 2.5 Pro，碳水含量估计值从 55 克到 484 克，整整相差了 429 克！估计值相对集中的是 Claude Sonnet 4.6，但波动范围也不小。



再以奶酪三明治的照片为例，包装上注明的碳水含量为40克，但 GPT-5.4 估计值平均为74克，其他三个模型为28克，都不正确。

另外，大模型也无法准确识别食物，比如有时会认为奶酪三明治里面夹着一块熟肉。

所以，别用大模型估算食物的碳水含量，也不要让大模型做任何精确的医疗估算，它根本做不到。

