#

#大模型

16篇文章

Jev:System One 模型的思考和尝试

是什么。 Jev 是 TypeSafe 的旗舰模型,也是第一个 System One 模型。一次请求里提交 和一组 typed questions,返回每道题的结构化答案、概率分布,以及 Choice/Score 的 confidence。它不生成给人类读的文本。 和 LLM 的差别。 常见 LLM…

RAG 和 Skill 能互相替代吗:边界、优缺点与组合方式

12 月 15 日的 RAG 知识库调优讲的是怎么从文档中找出能支撑答案的内容。后来用 Skill 时,我反复遇到一个问题:Skill 里也放 Markdown、规则和参考资料,模型也要把它们读进上下文。那它和 RAG 到底差在哪?一个能不能替掉另一个? 先给结论:它们在小范围内可以互相代用,在多数 Agent…

RAG 知识库调优:评估、切分、检索与重排

2022 年我整理过一篇 RAG:检索增强生成的收益与天花板,说明 RAG 解决的问题及其结构性限制。近年的工程实践增加了切分、检索和重排等环节的方法。本文讨论如何根据评估结果调整知识库配置,作为上一篇的补充。 知识库在 Agent 里的作用 在 Agent 场景中,知识库保存模型参数之外的信息,对应 RAG…

知识管理-AI笔记(AI大脑)

“AI 大脑”这个设想让我重新思考笔记系统。 人会遗忘。做决策时,之前接触过的信息如果无法有效召回,决策质量会受影响。 AI…

手写一个简单的 GPT:把学到的原理跑起来

本文是「零基础学大模型原理」系列的第 8 篇,实战篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

RAG:检索增强生成的收益与天花板

最近在研究怎么把大模型接到知识库上,RAG 是绕不开的方案。我看了一些资料,也动手试过。这篇先把它的原理、适用范围和限制理一遍。 RAG 是什么 大模型有两个常见问题:知识会过期,训练结束后不会自动更新;模型也会生成看似合理但实际错误的内容,也就是幻觉。 2020 年,Facebook AI Research…

longChain 学习

最近了解 Open AI 的过程中发现这个框架,把中文文档整理如下 LangChain 是一个使用语言模型驱动应用程序开发的框架。最强大、最具差异化的应用程序不仅仅通过 API…

三个月零基础学大模型:收获、疑问与下一步

本文是「零基础学大模型原理」系列的第 7 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

从 GPT-3 到 ChatGPT:指令微调与 RLHF

本文是「零基础学大模型原理」系列的第 6 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

GPT 系列:从 GPT-1 到 GPT-3 的演进逻辑

本文是「零基础学大模型原理」系列的第 5 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

Transformer 详解:自注意力、多头与位置编码

本文是「零基础学大模型原理」系列的第 4 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

Transformer 之前:RNN、seq2seq 与注意力机制

本文是「零基础学大模型原理」系列的第 3 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec Transformer 之前:RNN、seq2seq…

词怎么变成向量:从 one-hot 到 Word2Vec

本文是「零基础学大模型原理」系列的第 2 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播 词怎么变成向量:从 one-hot 到 Word2Vec…

神经网络入门:从感知机到反向传播

神经网络入门:从感知机到反向传播 本文是「零基础学大模型原理」系列的第 1 篇。这个系列记录一个没有任何机器学习背景的工程师,在 ChatGPT 发布之后从零补原理的过程。 神经网络入门:从感知机到反向传播(本文) 2022 年 11 月 30 日 ChatGPT…