LLM Ass Bench
摘要
LLM Ass Bench 是一个用于评估大型语言模型的基准测试工具,专注于提示词。
暂无内容
查看缓存全文
缓存时间: 2026/09/22 21:53
# LLM AssBench
来源:https://www.assbench.com/
提示 (https://www.assbench.com/PROMPT.md)
**提示**
相似文章
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
DLawBench:通过多轮法律咨询评估大语言模型
DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。
Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
BenchMIRT:LLM 基准测试实际在测量什么?
BenchMIRT 介绍了一种方法,使用多维项目反应理论在单个提示词级别审计 LLM 基准测试,分离安全性和一般推理等底层能力,以揭示基准测试实际测量的内容。