llm-evaluation

标签

Cards List
#llm-evaluation

选择而非评判:由LLM评分的评估基准

arXiv cs.AI · 11小时前 缓存

本文探讨了基于LLM评分的基准测试的测量限制,指出其泛化能力受到评判者差异的影响,且协议设计对性能上限有显著影响,从而对AI基准测试方法具有借鉴意义。

0 人收藏 0 人点赞
#llm-evaluation

当事实核查得分提高时发生了什么?训练后验证器与LLM中的证据和答案归因分析

arXiv cs.CL · 11小时前 缓存

本文量化了事实核查得分的提升如何在答案准确性和证据质量之间进行分配,使用了训练后的DeBERTa检查点和LLM在多个基准测试中。

0 人收藏 0 人点赞
#llm-evaluation

在句子层面分类解释准则:来自 German Federal Constitutional Court 的基准

arXiv cs.CL · 11小时前 缓存

本文介绍了一个用于在法律文件中分类解释准则的句子层面基准,评估了 LLMs 在 German Federal Constitutional Court 数据集上的表现。

0 人收藏 0 人点赞
#llm-evaluation

被识别但未生成:文化特异性亲属称谓的生成基准

arXiv cs.CL · 11小时前 缓存

本文介绍了一种生成基准,用于评测大型语言模型在Hindi、Tamil和Korean文化特异性亲属称谓上的表现,揭示了识别与生成能力间的显著差距。

0 人收藏 0 人点赞
#llm-evaluation

基于贝叶斯老虎机 Gittins 指数的高效成本感知 LLM 评估

arXiv cs.LG · 昨天 缓存

本文提出 GittinsEval,这是一个成本感知的贝叶斯老虎机框架,用于高效的 LLM 评估,通过自适应选择配置,在显著降低成本的同时保持高性能。

0 人收藏 0 人点赞
#llm-evaluation

MAWILE:多轴工作台用于检测LLM评估器

arXiv cs.AI · 昨天 缓存

MAWILE是一个开发者工作台,用于审计LLM评判者对提示词、评分标准、输入和输出扰动的敏感性,以确保评估的鲁棒性和有意义性。

0 人收藏 0 人点赞
#llm-evaluation

托管LLM中的无持久性复制:行动时信念评估的测量敏感性

arXiv cs.AI · 昨天 缓存

本文研究了托管LLM行为评估中的复制、测量敏感性和持久性,通过Regent Chess环境展示了不同配置和标识符下结论的变化。

0 人收藏 0 人点赞
#llm-evaluation

AI SYSTEM DESIGN系列博客第二篇

Reddit r/ArtificialInteligence · 昨天

本文讨论了如何针对特定生产用例对LLM进行基准测试,提出了一套全面的评估流程,包括任务特定指标、质量与成本的权衡,以及失败案例分析。

0 人收藏 0 人点赞
#llm-evaluation

超越准确性与表层流畅度:针对法律条款生成的LLMs风险敏感评估

arXiv cs.CL · 2天前 缓存

本文提出了一种针对LLM生成的合同条款的风险敏感评估框架,重点关注法律失效模式和质量维度,以评估超出准确性或流畅性的风险。

0 人收藏 0 人点赞
#llm-evaluation

校准作为LLM评估的首要标准

Hugging Face Daily Papers · 2天前 缓存

本文主张校准应作为LLM评估的首要标准,以增强可信度并解决部署和研究流程中的校准问题。

0 人收藏 0 人点赞
#llm-evaluation

LangChain: Jev-as-a-judge 现已在 LangSmith 中可用。对每个生产跟踪进行评分,而非抽样检查。每个跟踪检查更多标准...

X AI KOLs Timeline · 2天前 缓存

LangSmith 现已集成 Jev,一个 System One 模型,用于快速且经济的代理跟踪在线评估,实现更广泛的评分和安全检查,无需高昂成本。

0 人收藏 0 人点赞
#llm-evaluation

@FinanceYF5: ChatGPT共同发明人刚刚推出了一种完全不同类型的AI。它不聊天,而是做决策。决策速度…

X AI KOLs Timeline · 3天前

ChatGPT共同发明人推出了一款专注于决策的新AI,速度提升20-200倍,已在Doom、Minecraft和浏览器代理等场景中应用。

0 人收藏 0 人点赞
#llm-evaluation

中文辩论数据集与基准测试

arXiv cs.CL · 3天前 缓存

本文介绍了一个数据集和基准测试,用于评估大型语言模型对中文竞争性辩论的理解,包括148场比赛,由专业评审,并涉及比赛、阶段和发言者层面的任务。

0 人收藏 0 人点赞
#llm-evaluation

评估Devanagari OCR后校正的上下文学习和检索策略

arXiv cs.CL · 3天前 缓存

本文首次对大规模语言模型在印地语和马拉地语的OCR后校正进行系统性评估,比较上下文学习的检索策略,并展示CharBM25的有效性。

0 人收藏 0 人点赞
#llm-evaluation

Omni Demand Understanding: 多模态交互中上下文用户意图推理的基准测试

arXiv cs.CL · 3天前 缓存

本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。

0 人收藏 0 人点赞
#llm-evaluation

从出院记录到患者理解:基于角色的LLMs作为出院教育者的开放式模拟

arXiv cs.CL · 3天前 缓存

本文介绍了DischargeBench,一个基于角色的模拟,用于评估LLMs作为出院教育者,通过与虚拟患者的多轮对话来衡量患者理解。

0 人收藏 0 人点赞
#llm-evaluation

提示词不真实

Hacker News Top · 3天前 缓存

工程师Dan讨论了在生产环境中构建可靠AI智能体的挑战,强调了LLM的局限性以及这项工作既引人入胜又费脑力的特性。

0 人收藏 0 人点赞
#llm-evaluation

@realfxw: 把大语言模型用作“内容生成器”还是“逻辑判定层”,在系统吞吐量和推理成本上完全是两个维度的产物。 最近一位日本开发者分享了一组关于专用评估模型 JEV 的实测数据:输入 100 份面试纪要后,系统仅用 12.8 秒就完成了全员的“通过 /…

X AI KOLs Timeline · 4天前 缓存

专用评估模型 JEV 在面试纪要处理中展示了高效率和低成本的潜力,强调了将大语言模型用作逻辑判定层而非内容生成器的优势。

0 人收藏 0 人点赞
#llm-evaluation

@github:语言模型可以在干净的基准测试中表现出色,但在现实世界使用中重要的案例上仍然困难。…

X AI KOLs Following · 4天前 缓存

GitHub分享了用于将语言模型系统从原型移至生产的评估实践,解决现实世界的挑战和指标,如精确率和召回率。

0 人收藏 0 人点赞
#llm-evaluation

重新规划、修复还是编辑?资源中断下旅行代理行程修订的统一实证评估

arXiv cs.AI · 6天前 缓存

本文对资源中断下修订旅行行程的方法进行了统一的实证评估,比较了完全重新规划、计划修复和基于大语言模型的修订方法,评估维度包括有效性、计划稳定性和计算成本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈