问：人工智能这个概念是什么时候正式提出的？
答：1956年达特茅斯会议上，科学家首次正式提出人工智能这个概念，这标志着人工智能学科诞生。

问：人工智能的起源可以追溯到什么时候？
答：人工智能的发展历史可以追溯到20世纪50年代，1956年达特茅斯会议是其正式诞生的重要标志。

问：早期人工智能研究主要采用什么方法？
答：早期研究主要依靠符号推理和专家系统，通过人工编写规则来模拟人类的逻辑推理。

问：专家系统是怎样模拟人类推理的？
答：专家系统把领域知识写成规则，再根据这些人工设计的规则进行推理。

问：早期人工智能方法有什么局限？
答：规则很难覆盖现实世界的复杂情况，因此系统在特定领域可能有效，但面对开放环境容易受到限制。

问：深度学习为什么在21世纪后快速发展？
答：计算能力提升和大数据积累为深度学习提供了条件，深度神经网络能够从大量数据中自动学习特征。

问：深度神经网络和早期规则系统有什么不同？
答：早期系统依赖人工设计规则，而深度神经网络可以通过大量数据自动学习特征，减少对人工规则的依赖。

问：人工智能在哪些领域取得了突破？
答：人工智能在图像识别、语音识别和自然语言处理等领域取得了突破性进展。

问：Transformer架构对人工智能发展有什么作用？
答：近年来，以Transformer架构为基础的大语言模型进一步推动了人工智能的发展。

问：大语言模型是怎样学习知识的？
答：大语言模型通过在海量文本上进行预训练，学习语言知识和世界知识。

问：大语言模型可以完成哪些任务？
答：大语言模型能够完成对话、写作、翻译和编程等多种任务。

问：文章把大模型的知识看成什么？
答：文章认为大模型是在宏观层面对人类知识进行建模，用数学模型描述人类知识。

问：大模型中的参数有什么作用？
答：参数用来表示词元之间的数学关系，也就是不同信息之间的关联权重。

问：大模型训练的本质是什么？
答：文章将训练解释为寻找大量权重，用这些权重描述人类知识以及词元之间的关联。

问：大模型回答问题时是怎样生成内容的？
答：模型根据训练得到的权重，找出最可能的词元，并逐步生成答案。

问：文章如何概括大模型的本质？
答：文章把大模型概括为一种“压缩—生成”机制，先把知识抽象到参数中，再生成内容。

问：参数越多，模型一定越好吗？
答：参数更多通常可以更精确地描述知识，但参数增加会带来更高的训练、使用和计算成本，并不意味着所有场景都必须无限增加参数。

问：为什么模型不需要把所有知识都记在参数里？
答：有些知识可以通过逻辑推理获得，不必全部直接存储在参数中。

问：人口净增长率能否通过推理得到？
答：只要知道一个城市的人口出生率和死亡率，就可以通过推理得到人口的净增长率。

问：推理机制在大模型中起什么作用？
答：推理机制根据参数中已有的知识和逻辑规则，推断出没有直接包含在参数中的知识。

问：为什么大模型不能回答所有问题？
答：模型不可能包含所有知识，有些问题既没有相应的参数知识，也无法仅靠推理得到答案。

问：大模型能否直接知道今天的股票收盘指数？
答：如果参数中没有当天的股票数据，也无法通过逻辑推理得到，大模型就不能可靠回答这个问题。

问：联网机制解决什么问题？
答：联网机制可以让Agent或应用框架自动搜索互联网，获取参数和推理都无法提供的最新知识。

问：文章总结的AI三种机制是什么？
答：文章提到参数机制、推理机制和联网机制，分别用于提供基础知识、推导新知识和获取外部最新信息。

问：为什么大模型输入内容会收费？
答：模型需要把提示词分解成Token、转换成向量并计算Token之间的注意力关系，这一步消耗算力，因此输入Token通常会产生费用。

问：提示词越长会有什么影响？
答：提示词越长，需要处理的输入Token越多，输入费用也越高。

问：输入缓存有什么作用？
答：对于多轮对话和长任务，之前已经处理过的固定前缀可以缓存起来，后续直接复用计算结果，减少重复计算并加快处理。

问：为什么缓存命中价格更低？
答：缓存命中时不需要重复进行同样的输入计算，费用主要对应缓存存储，因此通常比未命中的输入价格低。

问：输入缓存会永久保存吗？
答：不会。缓存有时间期限，长时间没有使用时，服务器会删除缓存。

问：不同模型公司的缓存期限一样吗？
答：不一样。文章列举的期限包括Anthropic约5分钟、DeepSeek约10分钟、OpenAI约10至30分钟逐步失效、Google约1小时内逐步失效。

问：为什么AI Agent会定期发送激活请求？
答：为了尽可能延长缓存的有效时间，Agent可能定期向服务器发送请求，让缓存保持激活状态。

问：缓存激活请求完全免费吗？
答：不一定。激活请求本身也可能产生费用，因此需要在缓存节省的费用和激活请求成本之间权衡。

问：文章建议多久激活一次缓存？
答：文章认为缓存期限最短也有5分钟，因此相比每30秒一次，最新建议可以改成每4分钟自动激活一次。

问：本地运行AI模型可以选择哪两类硬件？
答：文章主要比较独立显卡和采用板载芯片组的家用电脑，也就是CPU、板载显卡和板载内存组成的统一内存设备。

问：RTX 5090有多少显存？
答：文章给出的数据是RTX 5090拥有32GB显存。

问：AMD Ryzen AI Max+ 395迷你电脑有什么内存特点？
答：文章介绍的设备采用板载芯片组，自带128GB内存，CPU和显卡共享这部分统一内存。

问：RTX 5090和AMD Ryzen AI Max+ 395的FP32算力分别是多少？
答：文章给出的数据是RTX 5090为104.8 TFLOPS，AMD Ryzen AI Max+ 395为14.8 TFLOPS。

问：为什么算力更强的RTX 5090不一定更适合运行大模型？
答：因为运行较大模型不仅需要算力，还需要足够的内存容量。RTX 5090的32GB显存可能装不下较大的模型权重。

问：70B模型使用4位精度大约需要多少内存？
答：文章估算，一个70B参数模型使用4位精度时，权重大约需要32.6GB内存，超过RTX 5090的32GB显存。

问：统一内存架构有什么优点？
答：板载芯片组让CPU和显卡共享大容量内存，可以为单个处理器分配更多内存，从而运行内存需求较大的模型。

问：统一内存架构的主要弱点是什么？
答：主要弱点是内存带宽较低，模型生成Token时读取参数的速度可能较慢。

问：内存带宽是什么意思？
答：内存带宽指内存向处理器传送数据的速度。

问：RTX 5090和AMD方案的内存带宽差距如何？
答：文章给出的数据是RTX 5090显存带宽约1792GB/s，而AMD方案内存带宽约256GB/s。

问：为什么内存带宽会影响Token生成速度？
答：模型每生成一个Token，都需要从内存中读取模型参数参与计算，带宽越低，单位时间能读取的数据越少，生成速度就可能越慢。

问：MoE模型为什么适合统一内存设备？
答：混合专家模型每次只激活部分参数，不需要每次都读取全部参数，因此可以降低每个Token需要读取的数据量。

问：Qwen3-30B-A3B每次大约激活多少参数？
答：文章以Qwen3-30B-A3B为例，模型总参数约30B，但每次只激活约3B参数。

问：本地运行大模型除了生成慢，还可能遇到什么问题？
答：如果设备算力较慢，处理很长的提示词也会耗时很久，用户可能需要等待较长时间才能看到第一个Token。

问：AMD迷你电脑处理4000个Token文档大约需要多久？
答：文章估算，使用70B模型时提示词处理速度约每秒95个Token，处理4000个Token大约需要40秒。

问：本地运行大模型应该如何选择硬件？
答：需要同时考虑内存容量和内存带宽：容量决定模型能否装入，带宽影响生成速度，不能只看单一指标。

问：文章对当前本地运行大模型的总体判断是什么？
答：现阶段无论独立显卡还是统一内存设备都有缺点，通常只能运行一些中等规模的MoE模型，并且提示词不宜过长。

问：人工智能发展带来了哪些社会问题？
答：文章提到数据隐私、算法偏见、就业结构变化，以及人工智能系统的安全性和可控性问题。

问：这些人工智能问题需要谁共同解决？
答：需要技术界、学术界和政策制定者共同努力解决。

问：文章中的AI知识系列还提到了哪些主题？
答：文章提到前两篇主题是“大模型需要多少内存”和“AI缓存是什么”。
