LLM Ass Bench

Hacker News Top 工具

摘要

LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/22 21:53

# LLM AssBench 来源:https://www.assbench.com/ 提示 (https://www.assbench.com/PROMPT.md) **提示**

相似文章

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。

BenchMIRT:LLM 基准测试实际在测量什么?

Hugging Face Blog

BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。