标签
一个LLM评判者在评估中持续返回固定的置信分数0.72,但切换到分类标签改善了分数分布,表明模型在分类方面比数值估计更适合评估。
Simon Willison 探讨了使用 HTML 而非 Markdown 作为 AI 输出格式的有效性,突出了 SVG 图表、交互式组件和丰富说明等优势。内容包含 Anthropic 公司 Claude Code 团队 Thariq Shihipar 的案例以及 GPT-5.5 的实用提示。