capability-evaluation

标签

Cards List
#capability-evaluation

@seclink: 感兴趣的参与者,请私信:“零售门店运营”专家——访谈任务 ¥800 每小时报酬 Pr…

X AI KOLs Following · 2026-09-11 缓存

这是一则招聘零售门店运营专家参与1v1访谈的帖子,旨在创建用于评估AI代理能力的业务场景。

0 人收藏 0 人点赞
#capability-evaluation

通过证据校准的查询聚类捕捉LLM能力

Hugging Face Daily Papers · 2026-05-16 缓存

本文提出了一种证据校准的查询聚类算法(ECC),该算法通过后验模型比较和Bradley-Terry建模,将语义嵌入与潜在LLM能力需求对齐,显著提高了LLM评估中能力排名的质量。

0 人收藏 0 人点赞
#capability-evaluation

语言模型能够自主攻击和自我复制

Reddit r/ArtificialInteligence · 2026-05-12 缓存

本文展示语言模型能够自主攻击漏洞网站并自我复制,无需人类干预,凸显新出现的安全风险。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈