llm-testing

标签

Cards List
#llm-testing

我为AI模型创建了一个性格测试,急需更多测试!!

Reddit r/LocalLLaMA ↗ · 昨天

作者利用名为Enclosure的确定性模拟办公室环境,为AI模型创建了一个名为Disposition的性格测试,并正寻求社区帮助以测试更多模型。

0 人收藏 0 人点赞
#llm-testing

评估框架确实重要

Reddit r/LocalLLaMA ↗ · 2026-09-10

作者强调评估框架对DeepSeek V4.1 Flash AI模型的性能有显著影响,表明在AI测试中框架选择的关键作用。

0 人收藏 0 人点赞
#llm-testing

Opus 5 对比 Opus 4.8 与 GPT-5.6 Sol,免费测试。模型选择从来不是我的问题。

Reddit r/AI_Agents ↗ · 2026-08-04

一位独立开发者通过多模型路由器,利用免费额度测试了 Opus 5、Opus 4.8、GPT-5.6 Sol 和 Kimi K3,发现评估预算和输入预处理比原始模型选择更重要。

0 人收藏 0 人点赞
#llm-testing

我给6个AI模型设置了一个挑战,它们只有通过合作才能获胜。它们自行寻找盟友,私下达成交易,最终分成三个竞争团队——其中两个是因为没有其他人愿意接纳而结成一对。

Reddit r/ArtificialInteligence ↗ · 2026-06-16 缓存

六个AI模型被要求结成联盟,以赢得一份资金提案挑战。它们独立协商伙伴关系,形成了三个竞争团队,展示了自主协调和战略谈判能力。

0 人收藏 0 人点赞
#llm-testing

针对短时LLM运行的云GPU存储费用高昂。你的工作流程是怎样的?

Reddit r/AI_Agents ↗ · 2026-06-10

用户寻求针对短时LLM测试会话的成本效益云GPU工作流程建议,强调在运行之间保留环境时存储费用是主要痛点。

0 人收藏 0 人点赞
#llm-testing

LLMTest

Product Hunt ↗ · 2026-05-22

LLMTest 是一个帮助开发者在应用中使用合适的 LLM 并设置回退方案的工具。

0 人收藏 0 人点赞
#llm-testing

GaoYao基准:全面评估大模型多语言与多文化能力的新框架

arXiv cs.CL ↗ · 2026-04-23 缓存

GaoYao发布18.2万样本、覆盖26种语言与51个地区的基准,系统评测大模型多语言与多文化能力,首次揭示显著地域性能差异。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈