标签
作者开源了 hackathon-searcher,这是一个用于发现、评估和帮助申请黑客松的工具,并正在寻求社区关于如何利用开源模型设计其评估层的建议。
Agent Reach 是一款免费开源工具,让 Claude 无需付费 API 密钥就能读取 17 个平台(YouTube、GitHub、Reddit、LinkedIn、X、Bilibili、微博等)的实时互联网内容,通过绕过官方 API 来避免费用。
Introduces Continuous Interaction Diffusion (CID), a diffusion-native model–runtime architecture that integrates tool interaction into iterative denoising, enabling asynchronous external reads while generation continues without waiting for discrete tool calls.
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。
作者分享了 agent-design-review Skill,用于系统化诊断和优化 Agent 架构,覆盖 Prompt、工具权限、上下文、安全、记忆、评估、成本、可观测性等多方面,并输出基于证据的 P0/P1/P2 问题,帮助避免常见踩坑。
本文介绍了Macaron-V1,一个开放的持续学习智能体-模型家族,使用Mixture-of-LoRA在冻结的基础模型上组合专家适配器,并具有递归自我改进和模型-框架协同设计。
作者讲述了使用 OpenAI 的 Codex 在 Snowflake 试用账户之间迁移数据的经历,并提出了 Codex 是否算作智能体的问题。
@tobi 的一条推文,演示了如何使用 CLI 工具 herdr——启动一个 agent 并运行 `herdr --skill`,来打造一个科幻电影风格的骇客终端界面。
一位开发者回顾了六个月来使用AI进行代码审查的经历,发现模糊的提示会产生看似合理但毫无用处的反馈。解决办法是将审查视为一个带门控的流水线,包含明确的上下文、分范围的检查、验证清单和对抗性自我批评。
本文介绍了Crafter,一种用于修正特征发现的智能体,通过组合搜索和LLM生成的特征来挖掘冻结黑盒预测器的残差,在六个数据集和骨干网络上实现了高达27%的错误率降低。
RA-CAD 提出了一种用于文本到CAD生成的状态感知智能体,采用生成-执行-批判-重写循环,并通过组相对策略优化进行反馈驱动的智能体优化。它在CADFusion和Text2CAD基准上实现了最先进的执行有效性和几何质量。
ReASearch 是一个统一框架,其中单个使用工具的智能体内化了用于优化提示、程序和机器学习工作流的搜索策略,在14项任务上优于专门的基线方法。
介绍 The Architect,一个 Claude Code 插件,能在写代码前通过访谈生成完整项目蓝图,支持 14 种项目类型,帮助避免架构跑偏和推倒重来。
CSDN 创始人蒋涛将直播讨论 Agent 从演示到真正可交付的难点,与 InfiniSynapse、InsCode 一起拆解如何接入真实数据、跑完长任务并处理失败。
MemArena 是一种新的自我中心基准,用于评估设备端个人记忆助手,它使用 MASim 智能体模拟器生成多会话对话世界,并在回忆、推理和可信度维度上提供真值。初步结果表明,记忆后端的选择通常比读取器规模更重要,而基于权限的访问仍然是一个普遍挑战。
UrbanAgent is a tool-augmented agent framework that uses LLMs with code execution, API calls, and MCP to handle cross-system urban requests. The authors also introduce UrbanEval, a benchmark for evaluating task results and execution quality, achieving 71% success rate over baselines.
林凯森离开盛大创新院后创办新公司,专注于长期记忆智能体,并提及在陈老板指导下工作的经历。
介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。