@ando_w: 今天面试了个候选人,简历写"精通 RAG"。 我问召回率多少,他说"挺好的"。我问怎么评估的,他说"问了几句感觉不错"。 这就是行业现状:90% 的 RAG 项目没有评估集,全靠手感。能说出 Recall 和 Precision 的,已经…
摘要
一位面试官吐槽自称“精通RAG”的候选人无法说出召回率和精确度,指出行业中90%的RAG项目缺乏规范的评估集,全靠主观判断。
今天面试了个候选人,简历写"精通 RAG"。
我问召回率多少,他说"挺好的"。我问怎么评估的,他说"问了几句感觉不错"。
这就是行业现状:90% 的 RAG 项目没有评估集,全靠手感。能说出 Recall 和 Precision 的,已经是前 10%。
查看缓存全文
缓存时间: 2026/07/09 09:40
今天面试了个候选人,简历写“精通 RAG“。
我问召回率多少,他说“挺好的“。我问怎么评估的,他说“问了几句感觉不错“。
这就是行业现状:90% 的 RAG 项目没有评估集,全靠手感。能说出 Recall 和 Precision 的,已经是前 10%。
相似文章
@shrav_10: 今天面试了另一位候选人。我问他什么是RAG,他回答:RAG是一种技术,能让LLM利用外部知识回答问题,而不仅仅依赖训练时学到的内容。
一位招聘经理分享了候选人对RAG和微调的正确描述,随后向关注者提问:何时应该选择其中一种而非另一种?
在应用场景中评估RAG指标:一项实验、发现与局限性
本文通过一项实证研究,比较了来自四个库(Ragas、DeepEval、RAGChecker、Opik)的RAG评估指标与人工判断及标准召回指标,并基于商业数据创建了问答数据集。
@sitinme: Github 30k star,不用向量数据库也能做 RAG,而且准确率还更高! 做 RAG 的人应该都有过这种体验:向量数据库返回的内容“看起来相关”,但就是不是你要的那个答案。 特别是处理合同、财报、技术手册这类长文档的时候,你问“第…
介绍一个GitHub上30k star的开源项目,通过推理而非向量数据库实现RAG,号称准确率更高,解决了向量检索中相似不等于相关的问题。
@pangmadee: https://x.com/pangmadee/status/2079740046169841799
本文讨论了企业级RAG系统的实现要点,包括模拟企业文档、embedding选择、引用追溯、版本控制和无答案处理等,强调诚实比流畅的错误回答更重要。
@lidangzzz: 我去年就跟你们说,用RAG和vector database一定是死路一条。正确做法是, 1. 正确用好memory; 2. 正确把内容分块,做好indexing,做好summarization; 3. 正确给agent提供search工具…
作者批评RAG和向量数据库的方法,提出正确的做法包括用好memory、分块和索引、摘要、为agent提供搜索工具,以及使用SRAM-only推理服务如Groq和Cerebras。