标签
Presents TeXFix-Bench, a multi-format benchmark for LLM-based document source repair, grounded in a mined fault taxonomy across LaTeX, Typst, and Markdown. Benchmarks seven LLMs with 48,651 attempts, showing compile success alone overstates repair quality.
作者构建了一个用于Convex后端的确定性重放引擎,支持使用生产快照进行本地调试以及控制异常测试,正在寻求用户反馈。
变异测试现已在 sydtest Haskell 测试框架中正式发布,开发者可通过自动生成代码变异并验证测试套件是否能捕获这些变异,从而客观评估测试质量。作者的动机源于 AI 生成代码(通过 Claude)的兴起,以及对测试覆盖率进行客观、自动化度量的需求。