ai-evals

标签

Cards List
#ai-evals

@HamelHusain: 是的!二元评判对大多数人来说实用得多,因为李克特量表(或评分)有太多陷阱。所有…

X AI KOLs Timeline · 2026-06-28 缓存

Hamel Husain 分享了一份 AI 评估课程的闪卡和见解,主张在实际的 LLM 评估中使用二元评判而非李克特量表。

0 人收藏 0 人点赞
#ai-evals

@swyx:所有评估/分析类初创公司将在2026年经历一次性的代际升级,转型为持续学习平台…

X AI KOLs Following · 2026-05-31 缓存

作者预测,评估/分析类初创公司将在2026年转型为持续学习平台,其中一些会失败,而品味不凡的将胜出。

0 人收藏 0 人点赞
#ai-evals

按需生成合成训练数据时,什么才是关键?

Reddit r/ArtificialInteligence · 2026-05-14

Abliteration 推出了一种按需定制的合成训练数据工作流,可为分类器生成负样本、罕见样本和对抗性样本,包含模式、真实世界事实、标签、来源追溯,并支持导出到 Hugging Face 等平台。

0 人收藏 0 人点赞
#ai-evals

@arizeai:.@Chi_Wang_ 在过去几年中不断拓展 Agent 的边界,从 AutoGen 的多智能体愿景到……

X AI KOLs Following · 2026-05-09 缓存

Arize AI 将在旧金山举办 Observe 2026 大会,聚焦 AI Agent 及其评估领域,OpenAI、Cursor 和 Uber 的演讲嘉宾将出席。本次大会包含关于多智能体系统及前沿 Agentic AI 的主题演讲。

0 人收藏 0 人点赞
#ai-evals

@pauliusztin_:每天都有100+人问我“怎么学AI评估?”我每次都把11个链接直接粘贴:1. AI评估与可观测(系列)

X AI KOLs Timeline · 2026-04-21

一份每日被反复转发的11个精选链接,帮你掌握AI评估技术,涵盖评估方法、可观测性、LLM-as-judge与智能体评估。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈