标签
StudyArena 的一项盲测显示,学生在撰写大学论文时更偏好 Gemini 而非 ChatGPT 和 Claude,选择率达到 39.6%。
Claire Vo 宣布发布 Opus 5,这是一个她不喜欢使用的模型,但在与 Fable 和 GPT-5.6 的盲测中排名最高。Dan Shipper 表示赞同。
提出一种使用Three.js的盲视觉范式,用于测试从大模型提取的过程性脚手架能否在无需微调的情况下提升小模型输出,并由盲评模型验证。