标签
Mimo 和 DeepSeek 优化了 AI 模型,以 2-3 倍的利润实现了低定价,详情见其官方博客。
Superpowers 6开源项目展示了AI不仅能写代码,还能自主优化开发流程(如审计、合并任务、减少浪费),这标志着AI开始管理自身工作流,比人类管理者更严谨。文章强调诚实的评估体系(eval)是避免自我欺骗的关键。
本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。
讨论如何通过结构化信息而非将所有内容都输入语言模型的上下文来降低 token 成本,并以一个 RLM 代理处理大量日志行但只使用少量活跃 token 为例。
探讨一种推测性想法:通过适应LLM的原生通信模式(例如使用神经语)来优化人类与LLM的交互,而不是强迫它们适应人类语言。
Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。
关于使用CuTe DSL和瓦片编程模型重写并行性以提升FA4 (FlashAttention 4) 内核性能的讨论。
这条推文解释了运行AI模型实际上是运行优化的内核,推理引擎及其内核实现对于性能至关重要,而不仅仅是模型或硬件。
推测解码受1990年代CPU分支预测启发,现被Anthropic、Google和Meta用于将LLM推理速度提升2-3倍。它使用一个小模型来猜测未来的token,并用一个大模型并行验证它们,从而避免了解码期间GPU空闲时间。
这篇文章总结了 Andrej Karpathy 关于通过优化上下文使用、避免为简单任务使用过于强大的模型以及实施高效的路由策略来降低 AI 编程成本的建议。
Maxime Rivest 指出,面向图像的复合 AI 系统目前被严重低估,他建议借助 DSPy 和 GEPA 等优化框架,实现涉及 SAM 与分类器的流水线自动化构建。
Hermes Agent 通过观察自身表现、识别低效环节并改写技能,展示了自我改进能力,仅需两次迭代便实现了 3 倍的速度提升和 80% 的成本降低。
作者演示了在搭载 M5 Max 芯片的设备上,将 LivePortrait 的实现从 MPS 迁移到 Apple 的 MLX 框架后,性能和速度有了显著提升。
一位企业代理开发者讨论了使用像Ling 1T 2.6这样的开源模型的权衡,强调了相比于专有API,优化和基准测试的高昂开销。
开发者将Karpathy的autoresearch框架移植到自动化软件开发领域,并进行了多项优化,取得显著效果。
DeepMind's Deep Tank AI system optimizes the growth of 2D semiconductors, achieving 130-micrometer crystals—surpassing the target of 100 micrometers—and significantly accelerating the parameter search process for material fabrication.