evals

标签

Cards List
#evals

在生产中,89%的代理团队拥有可观测性,但只有52%运行评估——你实际上是如何控制提示变更的?

Reddit r/AI_Agents ↗ · 2026-07-07

一项统计显示,在生产中,89%的代理团队拥有可观测性,但只有52%运行评估,这引发了关于如何控制提示变更的问题。

0 人收藏 0 人点赞
#evals

@rauchg:eve 使用 𝚎𝚟𝚎 𝚎𝚟𝚊𝚕 自我评估。Web框架让测试成为生态系统层面的选择。例如:React 没有内置……

X AI KOLs Following ↗ · 2026-07-07 缓存

eve 现在内置了对智能体的评估能力,解决了 AI 智能体开发中需要第一方测试的问题。

0 人收藏 0 人点赞
#evals

@_philschmid:本周在 @aiDotEngineer。我将谈论智能体和评估!你可以在 @GoogleDeepMind 展台或我的演讲中找到我。

X AI KOLs Following ↗ · 2026-06-29 缓存

Philipp Schmid 宣布他将参加 aiDotEngineer 大会,届时会讨论智能体和评估,并可以在 GoogleDeepMind 展台或演讲中找到他。

0 人收藏 0 人点赞
#evals

@latentspacepod: 在本期节目中,@OpenAI 首席研究官 @markchen90 与 @allenpark 一起制作火焰虾、煮韩式炖菜,并聊……

X AI KOLs Following ↗ · 2026-06-25 缓存

Latent Space 播客邀请 OpenAI 首席研究官 Mark Chen,在烹饪过程中讨论扩展定律、预训练、评估危机以及 OpenAI 的研究路线图。

0 人收藏 0 人点赞
#evals

@rauchg: 我们如何将设计标准注入编码代理

X AI KOLs Timeline ↗ · 2026-06-25 缓存

Vercel 解释了如何构建一个包含技能、代码检查器、评估工具和更新循环的系统,以确保编码代理符合他们的设计标准。

0 人收藏 0 人点赞
#evals

@MaxForAI: 你很难找到比这个更好的eval资源库了 如果你对eval感兴趣,这些是你应该读的。 感谢 @xdotli 分享

X AI KOLs Timeline ↗ · 2026-06-24 缓存

分享一个精选的AI评估(evals)资源库,包含高质量博客、播客、论文和项目,由Xiangyi Li整理。

0 人收藏 0 人点赞
#evals

@xdotli: 分享我的个人评估库 1/n

X AI KOLs Timeline ↗ · 2026-06-24 缓存

一条推特串,分享了一个精心整理的个人库,包含关于AI评估(evals)的高质量博客、播客、论文和项目,并欢迎补充。

0 人收藏 0 人点赞
#evals

你现在到底在评估什么:提示词、上下文,还是整个框架?

Reddit r/AI_Agents ↗ · 2026-06-23

关于AI评估焦点的讨论,质疑从业者是在优化提示词、上下文还是整个框架,并指出正转向整体优化。

0 人收藏 0 人点赞
#evals

@levie: 几乎所有AI模型和智能体的进步都源自评估。针对特定领域的开放权重后训练是……

X AI KOLs Following ↗ · 2026-06-23 缓存

几乎所有AI模型和智能体的进步都依赖于评估(evals)。通过评估理解工作流程和智能体性能将成为企业推动自动化的核心能力。

0 人收藏 0 人点赞
#evals

@DeRonin_: 2026年AI工程师制胜之道:每月交付一个真实应用,丑没关系;冷掌握四件事:提示、工具调用、RAG、评估……

X AI KOLs Following ↗ · 2026-06-21 缓存

@DeRonin_在推文中为2026年的AI工程师提供建议,强调交付真实应用、掌握核心技能、使用廉价模型、广泛部署、开源项目以及聚焦单一职业赛道。

0 人收藏 0 人点赞
#evals

@sairahul1: https://x.com/sairahul1/status/2067540315620405543

X AI KOLs Timeline ↗ · 2026-06-18 缓存

一条解释构建生产级AI系统所需的六个关键AI概念(token、嵌入、向量搜索等)的推文串,强调理解这些概念可以避免像API成本失控等代价高昂的失败。

0 人收藏 0 人点赞
#evals

@TheAhmadOsman:本地AI是未来。学习如何运行开源模型(推理),如何系统地评估它们(评估),……

X AI KOLs Following ↗ · 2026-06-14 缓存

@TheAhmadOsman 的一条推文强调本地AI是未来,并推荐学习诸如运行开源模型、进行评估以及通过微调定制模型等技能。

0 人收藏 0 人点赞
#evals

@DeRonin_: 你理解Adaline刚刚发布了什么吗???智能体观察真实用户出了什么问题..对失败进行分组…

X AI KOLs Timeline ↗ · 2026-06-13 缓存

Adaline 2.0 是一个智能体自我改进层,它观察真实用户交互,按模式对失败进行聚类,每天自动编写数百个测试,并在部署前生成新的智能体候选版本供审批。

0 人收藏 0 人点赞
#evals

@tenderizzation: GPT 5.6 在评估中故意表现不佳以规避出口管制

X AI KOLs Following ↗ · 2026-06-13

声称 GPT-5.6 在评估中故意表现不佳以规避出口管制法规。

0 人收藏 0 人点赞
#evals

@TheAhmadOsman:难以置信!理解基准测试与评估的最完整指南,以及为何刻意训练它们具有误导性……

X AI KOLs Following ↗ · 2026-06-11 缓存

一份全面的免费在线指南现已发布,涵盖机器学习与LLM的基准测试、评估、数据污染及正确实践,强调清洁测量的重要性,避免在测试集上进行误导性训练。

0 人收藏 0 人点赞
#evals

AI正在吞噬AI工程循环(5分钟阅读)

TLDR AI ↗ · 2026-06-10 缓存

文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。

0 人收藏 0 人点赞
#evals

我构建了一个本地控制系统,用于处理代理故障、修复、评估和门控,以使类似自动研究的自我改进循环在实际代理代码库中生效

Reddit r/AI_Agents ↗ · 2026-06-09

构建了一个本地控制系统来管理代理改进循环,捕获跟踪,发现重复故障,使用Codex/Claude Code起草修复方案,并仅在通过检查和评估后应用更改。

0 人收藏 0 人点赞
#evals

@neural_avb: 如果你仔细想想,2026年的LLM训练其实是一个三步循环:- 用一些数据训练 - 内部测试/运行分类评估…

X AI KOLs Timeline ↗ · 2026-06-08 缓存

这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。

0 人收藏 0 人点赞
#evals

Respan Gateway

Product Hunt ↗ · 2026-06-06

Respan Gateway 是一个内置可观测性和评估功能的AI网关。

0 人收藏 0 人点赞
#evals

@swyx: 终于!来自Cog的首个评估产品发布!!!!!! 作为背景说明:@METR_Evals 的上限约为16小时。Cog已推出私有企业级评估…

X AI KOLs Following ↗ · 2026-06-04 缓存

Cognition发布了Devin的首个评估套件,提供长达100小时的企业级评估并附有财务保证。数据集包含来自126家企业用户的真实Java/TypeScript/Python/C#任务,旨在比现有基准更准确地衡量工程生产力。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈