标签
一位非工程师分享,在AI辅助的“氛围编程”中,最大的陷阱不是提示词,而是如何验证AI的修复是否真正解决了根本原因,还是仅仅修补了某个特定情况,导致代码脆弱。他提供了实用技巧,比如询问修复是通用的还是针对特定情况的,以及维护一份持续更新的设计文档。
作者分享了 agent-design-review Skill,用于系统化诊断和优化 Agent 架构,覆盖 Prompt、工具权限、上下文、安全、记忆、评估、成本、可观测性等多方面,并输出基于证据的 P0/P1/P2 问题,帮助避免常见踩坑。
一位开发者讲述了一个持续三周的生产环境 bug:一个包含字面退格字符的正则表达式静默地禁用了语言检测护栏,让 LLM 看起来不稳定。这篇文章强调了需要对确定性护栏进行埋点,以将其与模型的非确定性区分开来。
一位开发者描述了AI agent编写的Stripe处理器在webhook重试时对客户重复开通,以及如何使用FetchSandbox MCP模拟重试来捕获并修复幂等性bug。
httptap 是一个 Python CLI,可将 HTTP 请求剖析为 DNS、TCP、TLS 和数据传输等阶段,生成详细的瀑布时间线,用于故障排查和性能分析。
Jolt 是一种 Lisp/Scheme 语言,最近新增了两项功能:类似 Common Lisp 和 Smalltalk 风格的程序镜像,用于完整状态序列化与调试;以及一个与 Chez 运行时解耦的可移植 Scheme 后端,实现与架构无关的可移植性。
本文探讨了 LuaJIT 的一个陷阱:诸如 unpack 之类的未实现(NYI)操作会悄然导致 trace 黑名单化,从而使基准测试性能降低 20 倍,并提供了在 CI 中防范此类问题的方法。
GraphARC 是一款开源 MIT 许可工具,利用本地 8B 模型(qwen3:8b)来规划并执行多节点调查图,用于根因分析;通过确定性准入门控强制执行策略与预算检查。它提供实时浏览器视图、仅追加的 JSONL 审计轨迹,并支持通过 CLI 使用 Ollama、OpenRouter、OpenAI 或 Claude。
VeriTrace 是一个用于自动化 Verilog RTL 生成的多智能体系统,它引入了智能体时间探索(Agentic Temporal Exploration),使调试智能体能够完全控制信号选择、时间窗口和迭代深度,在 VerilogEval-V2 上实现了 100% 的 Pass@1,并比基线模型高出 +5.1% 的性能。
作者构建了 Agent DevTools,这是一个用于 AI 智能体的本地调试器,可检查提示词、记忆、检索和工具调用,支持 LangChain,并提供了一个免费的 Groq 演示。
Pinterest Engineering 分享了一项关于 CPU 瓶颈和网络驱动程序问题的详细调查,这些问题导致基于 Ray 的训练任务在其 Kubernetes 平台上崩溃,并提供了分析性能问题的经验教训。
作者解释了为什么客户的PDF银行对账单上所有金额都显示为负数:PDF在与背景相同的灰度级别中编码了不可见的尾随负号,提取代码将其当作可见文本读取。他们讨论了OCR或剥离非黑色文本等解决方案。
本文回顾了一起AI助手错误确认服务的事件。故障排查发现知识库检索未被记录,导致无法将回答归因于检索到的上下文。文章强调,为验证回答的依据,需要对检索进行按对话轮次可追溯的日志记录。
NVIDIA分享了其Exemplar Cloud项目的调试经验,详细说明了SMMU电源管理、NUMA放置、NCCL队列对并发以及硬件缺陷等配置问题如何导致AI集群8-12%的训练吞吐量差距,以及如何诊断和修复这些问题。
一篇博客文章揭示了 Zig 的 std.Io.Writer.Allocating 中存在的内存过度分配错误,原因是 `drain` 函数在每个数据切片上错误地预留了 splat 参数的空间,导致内存意外增长。
pytest-leak-finder 是一个 pytest 插件,它使用二分查找来识别当一起运行时,哪个更早的测试导致后续测试失败。
一位开发者详细说明了他们的AI智能体为何保持沉默——原因是安全守卫故障关闭、超时以及嵌套JSON问题,并强调在面对客户的聊天机器人中,沉默故障比错误答案更糟糕。
一位开发者反思AI编码工具如何提升生产力,但可能阻碍深度学习——用户交付了不完全理解的代码,引发关于技能发展的疑问。