标签
一条来自 @reach_vb 的推文,向 @simonw 询问评估 AI 模型或 harness 的方法,提到了已饱和的 'pelican on a bike svg' 基准。
A new survey from Renmin University reviews nearly 1,000 studies on long-horizon AI agents, arguing that reliable long-horizon intelligence depends on the whole model-harness system, not just larger context windows or stronger models.
一位开发者认为,AI模型周围的框架(评审、脚手架)比模型本身更重要,并分享了一个例子:一个27B模型在优秀评审的帮助下变得可用于编码工作。