llm-benchmarking

标签

Cards List
#llm-benchmarking

PICasso:一个用于硅光子器件自主优化的AI赋能设计框架

arXiv cs.AI · 18小时前 缓存

PICasso是一个AI赋能框架,可根据自然语言规格自主优化硅光子器件,通过LLMs和仿真反馈显著提升了设计满足度并降低了损耗。

0 人收藏 0 人点赞
#llm-benchmarking

从全球基准到本地评估:为德国公共部门基准测试LLMs

arXiv cs.CL · 2026-08-19 缓存

本文介绍了MÖVE,一个针对德国公共部门LLMs的整体评估框架,考察了能源消耗、提供商透明度和德国政党立场知识等治理维度,揭示了需要根据具体上下文选择模型的权衡。

0 人收藏 0 人点赞
#llm-benchmarking

当故事演变时:在开放世界模拟中跨智能体架构的大语言模型叙事基准测试

arXiv cs.CL · 2026-08-18 缓存

本文介绍了WSE-bench,这是一个用于评估开放世界模拟中大语言模型的过程基准,分别评估持续生成、规范一致性和有意义的发展。

0 人收藏 0 人点赞
#llm-benchmarking

SemPlan:针对企业数据的基于大语言模型查询的结构化语义规划基准测试

arXiv cs.AI · 2026-08-17 缓存

SemPlan是一个用于评估基于大语言模型查询中结构化语义规划的基准测试,使用包含1,800个案例的合成双语数据集比较四种架构。

0 人收藏 0 人点赞
#llm-benchmarking

格式敏感性指数:令牌控制的提示包装器鲁棒性与模式合规性在LLM基准测试中

arXiv cs.AI · 2026-07-14 缓存

本文介绍了格式敏感性指数(FSI)和可解析性敏感性指数(PSI),用于量化不同提示包装器下LLM准确率的变化。通过涉及多个模型和任务的14万次生成实验,研究表明包装器的选择会显著影响得分,而解析失败是其中的关键驱动因素。

0 人收藏 0 人点赞
#llm-benchmarking

在 Anubis OSS 的 UI 中新增了直接下载模型的功能——如果有人愿意帮忙测试,那就太好了

Reddit r/LocalLLaMA · 2026-05-26

Anubis OSS 是一款用于本地 LLM 基准测试的 Apple Silicon Mac 应用,现在支持通过 UI 中的“浏览模型”按钮直接从 ollama.com 库下载模型。开发者正在寻找测试人员,以确认安装和功能正常运行。

0 人收藏 0 人点赞
#llm-benchmarking

每个成功目标的能量:自主AI系统的目标级能量核算

arXiv cs.AI · 2026-05-25 缓存

本文提出A-LEMS框架,将AI能量核算从每次推理重新定义为每个成功目标(EpG),并引入编排开销指数(OOI)来衡量自主系统中多步编排的能量成本。实证结果表明,自主工作流每个目标的平均能耗比线性基线高4.33倍,但OOI在工具增强型任务中可能反转,证明目标级核算是必要的。

0 人收藏 0 人点赞
#llm-benchmarking

构建了包含10个代理的投资组合构建管线——宏观、筛选器、6位分析师、协调器、构建器——运行于6个LLM提供商之上

Reddit r/AI_Agents · 2026-05-11

1rok是一个TypeScript框架,支持在多个LLM提供商上运行多代理投资组合构建管线,以对标它们在选股和仓位调整等金融任务上的表现。

0 人收藏 0 人点赞
#llm-benchmarking

@no_stp_on_snek:mrcr v2 在 1m 长度下完成 8-needle 测试,采用开源权重堆栈,仅单台租赁 mi300x。longctx directional 0.688(n=30,mass-val 重跑待更新…

X AI KOLs Following · 2026-05-08 缓存

分享了一套开源模型堆栈在单卡 AMD MI300X 上运行的早期基准测试成绩与评估指标,表明其性能已具备与闭源方案竞争的实力。

0 人收藏 0 人点赞
#llm-benchmarking

4x RTX 3090 上的 Qwen3.5-27B、Qwen3.5-122B 和 Qwen3.6-35B —— MoE 模型在严格全局规则下的表现困境

Reddit r/LocalLLaMA · 2026-04-20

潜水多年的老用户,首次发帖。在 4 张 RTX 3090 上对三款 Qwen 模型分别进行了 20 多个会话的实时智能体工作测试——**Qwen3.5-27B** 稠密模型、**Qwen3.5-122B-A10B** MoE 和 **Qwen3.6-35B-A3B** MoE。以下数据均解析自持续真实负载下的 vLLM 日志,而非合成基准测试。**本文所有数据的关键负载背景:** 测试框架是一个多智能体编排器,同时运行 1-6 个并发的 OpenCode 会话,Prompt 长度为 30-60k token,并且强制执行**严格的 Bash 允许列表

0 人收藏 0 人点赞
← 返回首页

提交意见反馈