#大模型

14 篇文章

RAG 知识库调优:评估、切分、检索与重排

2022 年我整理过一篇 RAG:检索增强生成的收益与天花板,谈了它解决什么问题,又有哪些结构性的限制。这几年 RAG 的工程实践往前走了很多,切分、检索、重排每个环节都沉淀出了更细的方法。这篇把”怎么把知识库从能用调到好用”整理一遍,算是上一篇的续篇。 知识库在 Agent 里的位置 在 Agent 的语境下,知识…

知识管理-AI笔记(AI大脑)

让我时隔很多年重新思考笔记这个问题是源于一个“AI大脑”的灵光乍现 过去我有一个很大的痛点:人是会忘记的,这导致在做决策的时候有些信息之前虽然有接触,但是没办法有效召回导致决策质量较差。 现在AI的能力和工程能力绝对可以做到一个“虚拟的我”,祂是我过往所有经验的总和,当我有什么问题和他沟通的时候,一定会贴合我自己的想…

RAG:检索增强生成的收益与天花板

最近在研究怎么把大模型接到知识库上,RAG 是绕不开的方案。我看了一些资料,也动手试过。这篇先把它的原理、适用范围和限制理一遍。 RAG 是什么 大模型有两个常见问题:知识会过期,训练结束后不会自动更新;模型也会生成看似合理但实际错误的内容,也就是幻觉。 2020 年,Facebook AI Research 在 N…

longChain 学习

最近了解 Open AI 的过程中发现这个框架,把中文文档整理如下 LangChain 是一个使用语言模型驱动应用程序开发的框架。最强大、最具差异化的应用程序不仅仅通过 API 调用语言模型,还将具备以下特点: 数据感知:将语言模型与其他数据源连接起来。 自主性:允许语言模型与其环境进行交互。 该框架旨在遵循上述原则…

从 GPT-3 到 ChatGPT:指令微调与 RLHF

没有机器学习背景的工程师补大模型原理的第六站:GPT-3 的续写惯性怎么变成 ChatGPT 的对话行为,指令微调、人类排序训练奖励模型、PPO 三步各自做了什么,以及对齐的代价。

GPT 系列:从 GPT-1 到 GPT-3 的演进逻辑

没有机器学习背景的工程师补大模型原理的第五站:GPT-1 的预训练加微调、GPT-2 的零样本苗头、GPT-3 的 1750 亿参数与上下文学习,以及 scaling law 和 Chinchilla 给出的规模规律。

Transformer 之前:RNN、seq2seq 与注意力机制

没有机器学习背景的工程师补大模型原理的第三站:RNN 为什么按顺序逐词处理,seq2seq 的固定向量瓶颈卡在哪,注意力怎么让解码端回头查所有输入位置,并用一个翻译例子手算注意力权重。

词怎么变成向量:从 one-hot 到 Word2Vec

没有机器学习背景的工程师补大模型原理的第二站:one-hot 为什么装不下语义,Word2Vec 怎么用「预测上下文」把词的含义学进几百维向量,以及负采样这个工程近似为什么必须存在。