Chroma 教程

它不是什么

🎉摘要:Chroma向量数据库不适用于主数据库(无事务、无join)、不能做精确匹配(返回近似最近邻),且单机版不适合海量数据(索引内存消耗大)。了解这些边界,才能在实际业务中正确使用。

前面了解了 Chroma 能干什么,下面介绍一下不能干什么,只有了解清楚它的边界,我们在实际业务场景下才能用好它。

注意,别指望它干下面这些事:

当主数据库用

它没有事务、没有 join、没有复杂 SQL,千万别把订单表搬进来。

正确姿势是:业务数据还在 MySQL/PG 里,Chroma 里只存“主键 id + 检索用的文本 + 一点点过滤字段”,查到 id 再回主库取详情。


做精确匹配

它返回的是“近似最近邻”(ANN),不是保证全局最优。

绝大多数场景这够用了,但你要是做去重、精确判重,别指望它 100%。


海量数据一把梭

Chroma 单机版(HNSW 索引)是把索引放内存的,千万级向量你得认真算内存,或者上分布式的 Chroma Cloud。官方给的经验值是单机百万级以内比较舒服。

说说我的看法
全部评论(
没有评论
关于
本网站专注于 Java、数据库(MySQL、Oracle)、Linux、软件架构及大数据等多领域技术知识分享。涵盖丰富的原创与精选技术文章,助力技术传播与交流。无论是技术新手渴望入门,还是资深开发者寻求进阶,这里都能为您提供深度见解与实用经验,让复杂编码变得轻松易懂,携手共赴技术提升新高度。如有侵权,请来信告知:hxstrive@outlook.com
其他应用
公众号