跳到主要内容

向量:让「意思」可以被计算

这一章讲三件事: 向量是什么(以及它不是「一串数」那么简单);把文字变成向量的技术五十年来 走了哪几步、每一步解决了什么;选 embedding 模型和向量库时,哪些因素真的影响成败。 作者的原话:理解向量,「可以说是这整本书最重要的部分」1

1. 向量是什么:先纠正一个直觉

第 02 章把向量当成黑盒用了一回。现在打开它。

向量不是「一串数」,是一个既有量级、又有方向的数学对象。 书里借电影《神偷奶爸》反派 Vector 的台词点题——「一个由箭头表示的量」。这个「方向」不是玄学装饰:方向相近的向量, 对应的文字意思就相近;两个向量的夹角、距离,就是「像不像」的度量2

词源里还藏着另外两条性质,作者各给了一句:

  • 数学: 向量让文字可以被数学运算处理——这是「意思可计算」的前提;
  • 速度: 向量搜索比它之前的任何文本搜索技术都快3

术语先钉死: 向量(vector)是数学里的通用概念,各行各业都用;在 NLP(自然语言处理——让计算机处理人类语言的分支)和 RAG 的语境里, 这同一件东西叫 embedding(嵌入)。书里明确说:在 RAG 的讨论里,embeddings、vectors、 vector embeddings 这些叫法可以互换4。本文往后一律用「向量」,遇到 embedding 你知道是同一件事。

2. 主走查:一个问题的向量长什么样

拿全书那个老问题 What are the advantages of using RAG? 走一遍。

用 OpenAI 的 embedding 服务把它变成向量,打印前 5 个数5:

[-0.006319054113595048, -0.0023517232115089787, 0.015498643243434815,
-0.02267445873596028, 0.017820641897159206]

从这个真实输出里能读出三件事:

  1. 维度(dimension)是向量的长度。len() 一数,完整向量是 1536 个数—— 也就是「1536 维」。人类最多直观想象三维,而这 1533 个多出来的维度, 正是向量能装下细粒度语义的原因6
  2. 每个数都是高精度浮点。 第一个数小数点后有 18 位——这是 64 位双精度浮点格式。 精度越高,语义的细微差别保留得越好;如果你在乎回答质量,选 embedding 服务时要注意它的精度格式7
  3. 它长得像 Python 列表,但请当它是 NumPy 数组。 机器学习(让计算机从数据里自己学规律的技术)全家桶(SciPy、pandas、 scikit-learn、PyTorch…)都按 NumPy 数组优化过,处理速度快得多8

顺带钉死一个尺寸事实:不管文本多长,同一个模型给出的向量维度都一样。 10 个 token 的问题是 1536 维,几千字符的文档块也是 1536 维——这看似违反直觉, 却是检索能工作的前提:维度不一样,根本没法算距离9

维度的代价与「套娃」解法

1536 维表达力强,但搜索慢。新一代模型(如 OpenAI 的 text-embedding-3-large)允许你选更小的维度, 而且训练时就保证了「大小不同的向量表达同样的语义」——这叫 Matryoshka embeddings (名字来自俄罗斯套娃:大娃套小娃,每个都还是完整的娃)10

它解锁的玩法叫自适应检索(adaptive retrieval):先用低维向量快速搜索,把范围缩小到目标附近, 再换高维(维度数更多的)向量精确定位。作者给的提速数字是 30%–90%,取决于配置——生产环境高负载时值得考虑11

相关的还有量化(quantization):把高精度浮点压成低精度,省内存省算力——但它是有损压缩,精度会掉12

3. 五十年进化史:四代向量化技术

作者带读者把四代技术在同一份数据上各跑了一遍。这张进化表是本章的核心13:

先认两个词:注意力,即每个词都去看上下文里别的词、按相关度取信息的机制。

自注意力,即多个注意力层叠起来、前后两个方向都看的设计——BERT 靠它吃饭。

代际代表怎么工作强项短板
1972TF-IDF统计词在文档里出现的频率与稀有度便宜、快、可解释不懂语义,就是个关键词计数器
2013 前后Word2Vec / Doc2Vec神经网络学词/文档的向量,考虑上下文语义的雏形小语料上训练不稳
2018BERTTransformer(一种靠注意力——即每个词都去看上下文里别的词、按相关度取信息——机制处理文字的神经网络架构)预训练模型,有自注意力(多个注意力层叠起来、两个方向都看)的设计语义理解强、可本地跑专业域上不微调就不好用
现在OpenAI 等大厂服务超大模型的服务级 embedding开箱即用、质量高收费、依赖网络、绑定模型

第一代:TF-IDF,1972 年的关键词统计

TF-IDF 的思想源头是 1972 年 Karen Spärck Jones 的论文:一个词的「区分度」, 与它出现的文档数成反比14。书里给的例子非常好记——拿莎士比亚的 37 部剧做统计:

  • Romeo 只出现在一部剧里,且在那部剧里高频出现 → df=1(文档频率),idf=1.57(逆文档频率,全场最高)。 看到 Romeo 这个词,你基本知道这页纸出自哪部剧。
  • sweet 每部剧都出现 → df=37,idf=0。它对「这是哪部剧」毫无区分度15

作者的代码实验室在全书的数据上跑 TF-IDF,然后拿同一个问题去检索——结果和 OpenAI embedding 的检索结果一致16。 他随即泼冷水:别高兴太早,这是小语料的巧合;真实世界的大数据和复杂查询,还是要靠现代 embedding17

这次实验还顺带暴露了两个普遍教训:一是 TF-IDF 产出的向量几乎全是零,即所谓稀疏向量(sparse vectors)。

二是它不懂语义——只统计「在少数文档里高频出现」,于是「1024」「192」这类数字排到了榜首,因为语料没清洗,数字恰好满足条件18。这类零多的向量,与 embedding 那种每位都有值的稠密(dense,即每个位置都有数)向量相对。

第二代:Word2Vec 与 Doc2Vec,语义的雏形

Word2Vec 一家用上了无监督学习:训练神经网络,让经常出现在相似上下文里的词,向量也相近。 按学习粒度分三档:Word2Vec 学词、Sentence2Vec 学句、Doc2Vec 学整篇文档19

作者的实验选了 Doc2Vec,自己训练:向量维度设 100 时,检索结果与 OpenAI 的不一致; 改成 1536 维后结果一致了,但结果不稳定——小语料训练的模型就这样20。 比 TF-IDF 强的地方在于它看上下文,不像 TF-IDF 只数词频21

第三代:BERT,预训练语义模型

BERT(110M 参数的 bert-base-uncased)把 Transformer 架构带进了 embedding——这正是后来 LLM 的底层架构, 只是 BERT 训练语料小得多。它预训练于维基百科与 BookCorpus,自带的 768 维输出开箱即用, 而且能在本地跑,不依赖任何 API——网络受限环境的救星22

作者的实验结果很诚实:不做微调直接用,检索回来的 top 文档跑偏了(抓回来一段法律口吻的文本)。 结论:本地小模型在专业域上,要考虑用你自己的数据微调23

第四代:大厂 embedding 服务

书里的规模对比值得一看:BERT 训练语料 33 亿词;GPT-3 约 17 万亿词(45 TB 文本); GPT-5 的训练语料估计 114 万亿 token,折合约 85–90 万亿词,是 GPT-3 的 5 倍左右24。 OpenAI 现役三款 embedding:ada-002(旧,便宜)、text-embedding-3-small/large(新,支持 Matryoshka)。

竞品也各有绝活:Google 的 gemini-embedding-001(2025-07 正式版)3072 维、支持 100 多种语言、MTEB 多语言榜首; AWS 的 Titan Text Embeddings V2 提供 256/512/1024 三档维度——512 维保住 1024 维约 99% 的精度, 256 维保住 97%,「砍维度几乎不掉精度」有了官方数字25

一张防坑表:embedding 质量不能只看跑分

  • MTEB 榜单是初筛,不是答案。 OpenAI ada-002 在 MTEB 拿 61.0%,text-embedding-3-large 拿 64.6%—— 但这不代表后者在你的应用里就好 3.6%,甚至不代表更好。最终标准只有一个:在你的数据上实测26
  • 榜单本身也被批评:新模型可能对基准数据集过拟合(即把考题背下来了,考试高分、实战拉胯);独立测试显示某些更便宜的模型 (如 Mistral-embed,某检索任务 77.8%)能赢过更贵的27
  • 领域模型可能碾压通用模型:科学论文语料训练的 embedding,在科学应用里可能明显更好—— 科学家说话的方式和社交媒体很不一样28。embedding 模型自己也能微调,这是很多人不知道的29

4. 选型五要素

原书把选 embedding 方案的考量归成五条,每条都来自前面的实验30:

因素关键事实
质量跑分只做初筛,用自己的数据+第 06 章的评测方法实测
成本OpenAI 最贵一档 $0.13/百万 token;一页 800 token 约 $0.000104——企业级乘起来可达数千上万美元
网络可用性API 服务断网即瘫;且不能配「备用本地模型」——查询与文档必须同一模型(见下)
速度本地不一定快(取决于模型推理速度);可一次处理一批(批即一次同时送入的一组)来优化
兼容性最重要也最容易被忽视,单列在下

兼容性单独说,因为它的后果最重:不同 embedding 模型产出的向量互不可比——同一家厂商的也不行。 OpenAI 自家三款模型互相不兼容。你用哪款模型入库,查询时就必须用同一款。 这意味着换模型 = 全库重新嵌入,数据量大时是一笔真金白银;也是选本地模型的理由之一—— 自己控制的模型,重算便宜得多31

5. 向量库:向量住在哪

向量产生后要有个地方住。向量数据库(vector database) 是专门为存取向量和相似搜索优化的数据库 (Pinecone、Milvus、Weaviate);向量存储(vector store) 是更大的伞术语,还包括 pgvector 这样的关系库扩展、FAISS 这样的库——LangChain 的抽象层就叫 vector store,原书从之32

内部架构三层:索引层(把向量组织成可快速缩小范围的结构)、存储层(管磁盘与内存)、处理层(可选,做实时运算)33

常见选项一图流(细节见原文地图)。表里三个词先说清:开源,即源代码公开、可自由使用。

GPU,即显卡——擅长并行算术的芯片,向量搜索提速常靠它。

SQL,即操作关系数据库(表格那一族)的查询语言。

选项一句话定位
Chroma开源、最易上手,本书的默认选择;一次性写入大量数据后需手动重建索引
pgvector已有 PostgreSQL(流行的关系数据库)团队的顺手之选;0.8.0 版查询提速至 9 倍、新增 halfvec 等类型
Milvus云原生、K8s 部署、GPU 加速,规模优先
Pinecone全托管、免运维,贵
Weaviateschema 优先、GraphQL 风格查询
FAISS / ANNOY是库不是数据库;FAISS 能扛十亿级,ANNOY 小数据快

选型六要素(与基础设施的兼容、扩展与性能、易用与维护、安全合规、成本与许可、生态集成)中, 作者用 pgvector 举了最实际的一个例子:你的团队本来就是 PostgreSQL 专家,那 pgvector 大概率赢—— 把团队既有技能延伸进向量世界,比引入一套全新系统划算34。另一个企业现实:SharePoint 这类 内容管理系统里躺着大量非结构化文档,API 又方便抽取,很多大公司的 RAG 第一批数据就来自这里35

6. 边界与局限

  • 原书承认定向:本章只覆盖了一小部分向量化技术,「真实存在的选项远多于此」36
  • 向量库市场变化极快,作者原话:有些「等你读到这本书时可能已经倒闭」,动手前查最新版本37
  • 维度数的直觉陷阱:二维图上「看起来更近」的点,在 1536 维空间里未必近——相似搜索必须在全维度下算(下一章展开)。

7. 可带走的

  1. 向量 = 有方向有量级的数学对象;embedding 是它在 NLP 语境的名字,同一件事。
  2. 「长短文本同维度」是检索能工作的前提,也是新手最反直觉的一点。
  3. 维度即表达力,也是成本;Matryoshka + 自适应检索是「先粗后精」的提速路数(30%–90%)。
  4. 四代技术的分界:统计词频 → 神经网络学上下文 → 预训练 Transformer → 大厂服务
  5. Romeo vs sweet 是 TF-IDF 全部思想的两词总结:只在少数文档出现的词才有区分度。
  6. 换 embedding 模型 = 全库重嵌入;同厂商的模型也互不兼容。
  7. 跑分初筛,实测定案;MTEB 榜单会被过拟合,你的数据才是唯一标准。
  8. 选型先看团队既有技能:PostgreSQL 团队选 pgvector,多半好过引入新系统。

8. 原文地图

主题原书章原文位置
向量是全书最重要概念The Key Role Vectors and Vector Stores Play in RAGtext/11-fm-the-key-role-vectors-and-vector-stores-play-in-r.txt:14(搜「secret ingredient」)
embeddings 与 vectors 的关系What is the difference between embeddings and vectors?text/12-fm-what-is-the-difference-between-embeddings-and-ve.txt:4(搜「a specific type of vector representation」)
方向与量级(反派台词)What is a vector?text/13-fm-what-is-a-vector.txt:13(搜「quantity represented by an arrow」)
数学/速度/精确三性质What is a vector?text/13-fm-what-is-a-vector.txt:4(搜「mathematical representations」)
前 5 维真实输出与 64 位精度Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:17(搜「0.006319054113595048」) · text/14-fm-vector-dimensions-and-size.txt:23(搜「double-precision」)
1536 维与 len()Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:50(搜「Embedding size: 1536」)
长短文本同维度也能比Vector similarity compares your vectorstext/17-fm-vector-similarity-compares-your-vectors.txt:58(搜「still going to give you an embedding that is the same size」)
NumPy 数组Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:26(搜「NumPy array」)
Matryoshka 与自适应检索Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:61(搜「Matryoshka embeddings」) · text/14-fm-vector-dimensions-and-size.txt:61(搜「adaptive retrieval」)
提速 30-90%Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:61(搜「30–90%」)
量化与有损Vector dimensions and sizetext/14-fm-vector-dimensions-and-size.txt:33(搜「quantization」)
1972 年 IDF 起源Term frequency-inverse document frequency (TF-IDF)text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:7(搜「inverse document frequency」)
Romeo/sweet 莎剧例Term frequency-inverse document frequency (TF-IDF)text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:10(搜「Romeo」)
稀疏 vs 稠密向量Term frequency-inverse document frequency (TF-IDF)text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:36(搜「sparse vectors」)
TF-IDF 结果与 OpenAI 一致 + 泼冷水Term frequency-inverse document frequency (TF-IDF)text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:80(搜「They match!」) · text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:80(搜「definitely NOT the case」)
数字登顶的教训Term frequency-inverse document frequency (TF-IDF)text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:54(搜「no understanding of semantics」)
Word2Vec/Doc2Vec 分工Word2Vec, Sentence2Vec, and Doc2Vectext/19-fm-word2vec-sentence2vec-and-doc2vec.txt:7(搜「Word2Vec focuses」)
Doc2Vec 维度实验Word2Vec, Sentence2Vec, and Doc2Vectext/19-fm-word2vec-sentence2vec-and-doc2vec.txt:27(搜「vector_size=100」) · text/19-fm-word2vec-sentence2vec-and-doc2vec.txt:82(搜「results are not consistent」)
BERT 预训练与本地优势Bidirectional encoder representations from transformerstext/20-fm-bidirectional-encoder-representations-from-trans.txt:7(搜「standalone model」) · text/20-fm-bidirectional-encoder-representations-from-trans.txt:10(搜「self-attention」)
BERT 不微调就跑偏Bidirectional encoder representations from transformerstext/20-fm-bidirectional-encoder-representations-from-trans.txt:60(搜「not the best chunk」)
规模对比(33 亿 vs 17 万亿 vs 114 万亿)OpenAI and other similar large-scale embedding servicestext/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:17(搜「1.76 trillion」) · text/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:20(搜「114 trillion tokens」)
Google/AWS embedding 规格OpenAI and other similar large-scale embedding servicestext/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:23(搜「gemini-embedding-001」) · text/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:23(搜「99% of the accuracy」)
MTEB 跑分不可全信Quality of the embeddingtext/22-fm-quality-of-the-embedding.txt:4(搜「61.0%」)
成本 $0.13 与企业级放大Costtext/23-fm-cost.txt:4(搜「$0.13 per million tokens」)
断网与不能换备用模型Network availabilitytext/24-fm-network-availability.txt:7(搜「committed to that embedding model」)
本地不一定快Speedtext/25-fm-speed.txt:4(搜「not always faster」)
兼容性(同厂商也不兼容)Embedding compatibilitytext/26-fm-embedding-compatibility.txt:4(搜「same embedding model」)
换模型=全库重嵌入Embedding compatibilitytext/26-fm-embedding-compatibility.txt:7(搜「generate all new embeddings」)
域专用模型与微调 embeddingVector similarity compares your vectorstext/17-fm-vector-similarity-compares-your-vectors.txt:76(搜「domain-specific vectorization model」) · text/17-fm-vector-similarity-compares-your-vectors.txt:83(搜「fine-tune embedding models」)
稀释与平衡Vector similarity compares your vectorstext/17-fm-vector-similarity-compares-your-vectors.txt:64(搜「diluted」)
vector store vs vector databaseVector storestext/28-fm-vector-stores.txt:13(搜「purpose-built database system」) · text/28-fm-vector-stores.txt:16(搜「broader umbrella term」)
三层架构与 HNSW 预告Vector storestext/28-fm-vector-stores.txt:29(搜「Indexing layer」) · text/28-fm-vector-stores.txt:33(搜「Hierarchical Navigable Small World」)
pgvector 例(团队技能)Data sources (other than vector)text/27-fm-data-sources-other-than-vector.txt:10(搜「pgvector extension」)
SharePoint 是第一批数据源Data sources (other than vector)text/27-fm-data-sources-other-than-vector.txt:17(搜「SharePoint」)
常见向量库清单Common vector store optionstext/29-fm-common-vector-store-options.txt:16(搜「Chroma」) · text/29-fm-common-vector-store-options.txt:34(搜「pgvector」)
halfvec 等新类型Common vector store optionstext/29-fm-common-vector-store-options.txt:37(搜「halfvec」)
市场淘汰快Common vector store optionstext/29-fm-common-vector-store-options.txt:7(搜「go out of business」)
只覆盖了一小部分Code Lab 7.1 – Common vectorization techniquestext/17-fm-vector-similarity-compares-your-vectors.txt:94(搜「nowhere close to an exhaustive list」)

Footnotes

  1. 出处:「The Key Role Vectors and Vector Stores Play in RAG」第 14 段(text/11-fm-the-key-role-vectors-and-vector-stores-play-in-r.txt:14,搜「secret ingredient」);「最重要的部分」的表述见原书第 1 章「Understanding vectors」小节(text/04-fm-what-is-retrieval-augmented-generation.txt:466,搜「most important part of this entire book」)。

  2. 出处:「What is a vector?」第 13-16 段(text/13-fm-what-is-a-vector.txt:13,搜「quantity represented by an arrow」)。

  3. 出处:「What is a vector?」第 4-10 段(text/13-fm-what-is-a-vector.txt:4,搜「mathematical representations」;text/13-fm-what-is-a-vector.txt:7,搜「faster speeds」)。

  4. 出处:「What is the difference between embeddings and vectors?」第 4 段(text/12-fm-what-is-the-difference-between-embeddings-and-ve.txt:4,搜「used interchangeably」)。

  5. 出处:「Vector dimensions and size」第 13-18 段(text/14-fm-vector-dimensions-and-size.txt:17,搜「0.006319054113595048」)。这五个数是原书真实运行的输出。

  6. 出处:「Vector dimensions and size」第 50 段(text/14-fm-vector-dimensions-and-size.txt:50,搜「Embedding size: 1536」)与第 52 段(同文件,搜「1,533 dimensions」)。

  7. 出处:「Vector dimensions and size」第 23 段(text/14-fm-vector-dimensions-and-size.txt:23,搜「double-precision」);选型时留意精度的建议在第 38 段(text/14-fm-vector-dimensions-and-size.txt:38,搜「high-precision floating-point format」)。

  8. 出处:「Vector dimensions and size」第 26 段(text/14-fm-vector-dimensions-and-size.txt:26,搜「NumPy array」)。

  9. 出处:「Vector similarity compares your vectors」第 58 段(text/17-fm-vector-similarity-compares-your-vectors.txt:58,搜「same size as any of the other embeddings」)。

  10. 出处:「Vector dimensions and size」第 61 段(text/14-fm-vector-dimensions-and-size.txt:61,搜「Matryoshka embeddings」)。

  11. 出处:「Vector dimensions and size」第 61 段(text/14-fm-vector-dimensions-and-size.txt:61,搜「30–90%」)。

  12. 出处:「Vector dimensions and size」第 33 段(text/14-fm-vector-dimensions-and-size.txt:33,搜「lossy compression」)。

  13. 出处:「Code Lab 7.1 – Common vectorization techniques」第 94 段(text/17-fm-vector-similarity-compares-your-vectors.txt:94,搜「evolved significantly over the past few decades」)及各技术小节。

  14. 出处:「Term frequency-inverse document frequency (TF-IDF)」第 7 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:7,搜「inverse document frequency」)。原文引用 Spärck Jones 的定义:词的区分度可用其出现文档数的反函数量化。

  15. 出处:「Term frequency-inverse document frequency (TF-IDF)」第 10 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:10,搜「Romeo」)。df=1/idf=1.57 与 df=37/idf=0 均为原文数字。

  16. 出处:「Term frequency-inverse document frequency (TF-IDF)」第 80 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:80,搜「They match!」)。

  17. 出处:「Term frequency-inverse document frequency (TF-IDF)」第 80 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:80,搜「definitely NOT the case」)。

  18. 出处:「Term frequency-inverse document frequency (TF-IDF)」第 36 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:36,搜「sparse vectors」)与第 54 段(text/18-fm-term-frequency-inverse-document-frequency-tf-idf.txt:54,搜「no understanding of semantics」)。

  19. 出处:「Word2Vec, Sentence2Vec, and Doc2Vec」第 7 段(text/19-fm-word2vec-sentence2vec-and-doc2vec.txt:7,搜「Word2Vec focuses」)。

  20. 出处:「Word2Vec, Sentence2Vec, and Doc2Vec」第 27 段(text/19-fm-word2vec-sentence2vec-and-doc2vec.txt:27,搜「vector_size=100」)与第 82 段(text/19-fm-word2vec-sentence2vec-and-doc2vec.txt:82,搜「results are not consistent」)。

  21. 出处:「Word2Vec, Sentence2Vec, and Doc2Vec」第 85 段(text/19-fm-word2vec-sentence2vec-and-doc2vec.txt:85,搜「takes into account surrounding words」)。

  22. 出处:「Bidirectional encoder representations from transformers」第 7 段(text/20-fm-bidirectional-encoder-representations-from-trans.txt:7,搜「standalone model」)与第 10 段(text/20-fm-bidirectional-encoder-representations-from-trans.txt:10,搜「self-attention」)。

  23. 出处:「Bidirectional encoder representations from transformers」第 60 段(text/20-fm-bidirectional-encoder-representations-from-trans.txt:60,搜「not the best chunk」)与第 63 段(同文件,搜「fine-tuning」)。

  24. 出处:「OpenAI and other similar large-scale embedding services」第 20 段(text/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:20,搜「114 trillion tokens」)。BERT 33 亿词的对照见第 20 段(搜「3.3 billion words」)。原文注明 GPT-5 参数量非官方,为行业估计。

  25. 出处:「OpenAI and other similar large-scale embedding services」第 23 段(text/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:23,搜「99% of the accuracy」)。

  26. 出处:「Quality of the embedding」第 4 段(text/22-fm-quality-of-the-embedding.txt:4,搜「61.0%」)。

  27. 出处:「Semantic search example」第 78 段(text/32-fm-semantic-search-example.txt:78,搜「overfitting to benchmark datasets」;同段搜「Mistral-embed」)。

  28. 出处:「Vector similarity compares your vectors」第 76 段(text/17-fm-vector-similarity-compares-your-vectors.txt:76,搜「domain-specific vectorization model」)。

  29. 出处:「Vector similarity compares your vectors」第 83 段(text/17-fm-vector-similarity-compares-your-vectors.txt:83,搜「fine-tune embedding models」)。

  30. 出处:「Factors in selecting a vectorization option」第 35 段(text/21-fm-openai-and-other-similar-large-scale-embedding-s.txt:35,搜「Selecting the right vectorization option」)及第 22-26 段各小节。

  31. 出处:「Embedding compatibility」第 4 段(text/26-fm-embedding-compatibility.txt:4,搜「same embedding model」)与第 7 段(text/26-fm-embedding-compatibility.txt:7,搜「generate all new embeddings」)。

  32. 出处:「Vector stores」第 13-19 段(text/28-fm-vector-stores.txt:13,搜「purpose-built database system」;text/28-fm-vector-stores.txt:16,搜「broader umbrella term」)。

  33. 出处:「Vector stores」第 29-40 段(text/28-fm-vector-stores.txt:29,搜「Indexing layer」)。

  34. 出处:「Data sources (other than vector)」第 10 段(text/27-fm-data-sources-other-than-vector.txt:10,搜「pgvector extension」)。

  35. 出处:「Data sources (other than vector)」第 17-22 段(text/27-fm-data-sources-other-than-vector.txt:17,搜「SharePoint」)。原文:很多大公司由于数据价值高、API 抽取容易,第一批 RAG 数据就来自这类应用。

  36. 出处:「Code Lab 7.1 – Common vectorization techniques」第 94 段(text/17-fm-vector-similarity-compares-your-vectors.txt:94,搜「nowhere close to an exhaustive list」)。

  37. 出处:「Common vector store options」第 7 段(text/29-fm-common-vector-store-options.txt:7,搜「go out of business」)。