标签
SR-Fraud 是一种针对非平稳支付欺诈检测的结果监督反思型LLM智能体框架,在生产基准测试上相比传统方法提高了检测指标。
一位用户发现了一个代理,提供每天最多20小时免费访问 GLM 5.3 Flash 和 DeepSeek 4.1 Flash AI 模型,对 GitHub 注册和连续使用有额外奖励,无需支付信息。
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
Mark Zuckerberg 宣布推出 Muse 连接器,使开发者能够将其服务与 AI 代理和浏览器整合,实现无缝的用户交互。
本文提出了一种用于主动检测用户侧Human-LLM对话中隐式冲突的方法,引入了一个基准和合成方法来增强轻量级LLM的性能。
Claude Cowork 与 Chat 功能正逐步合并为统一的 Claude 服务,使其成为更集成的通用智能体。本次更新将首先向 Pro 和 Max 订阅用户推出。
本文介绍了Agent as Policy (AGP),这是一个框架,使通用智能体无需针对特定任务训练,即可直接控制物理机器人执行操作任务,在各种现实场景中实现高成功率。
一位用户展示了一个用Swift和Hono worker构建的原生个人行程规划代理,使用了Cloudflare的服务如Project Think、Browser Run、Durable Objects和R2,展示了Cloudflare在网页应用之外的多功能性。
T1 是一个拥有122B参数的混合专家模型,通过强化学习训练用于长期终端任务,在Terminal-Bench 2.1等基准测试中达到了最先进的结果,并超越了GPT-5.4和GLM-5.1等模型。
这篇文章揭示了如何使用Topview和Agent工具制作出全网播放量达几千万的AI视频,整个过程仅花费约一个半小时。
Qwen 3.8 27B 是一个拥有270亿参数的AI模型,在本地RTX 5090 GPU上运行时,在个人基准测试中超越Opus 4.8,速度高达每秒200个令牌,无需互联网或API访问。
Karpathy 的 LLM 知识库自动化方法强调迭代式源信息导入、将答案归档回知识库,以及定期校对以保持一致性,倡导用户深度参与过程。
一位开发者就发布一个自托管、开源的AI工具寻求社区反馈,该工具用于研究、文档创建和代理功能,灵感源自Manus和Perplexity。
Blender Agent Bridge 是一款开源的 MCP 桥接工具,旨在将 AI 工作流集成到 Blender 中,通过 AI 工具增强 3D 建模能力。
DeepSeek 宣布 DeepSeek-V4-Pro 正式发布(GA),包含重大智能体升级、灵活的推理努力等级、原生 OpenAI Responses API 支持,以及更新的 API 定价,引入高峰和低峰费率,低峰期价格降低 50%。
本文提出SDAM,一种基于记忆的复杂Text-to-SQL框架,利用结构差异感知推理、矛盾感知反思和基于模式的记忆演化来改进SQL生成。实验在BIRD-dev和Spider-test基准上展示了适度的性能提升。
dots-studio 发布 dots3-note 预览版,这是 dots3 系列中首个开放权重模型:一个拥有 2800 亿参数的多模态 MoE,激活参数为 160 亿,支持 512K 上下文,并能理解文本、图像、视频和音频。
推文介绍了 Deepseek Harness 的轨迹模式,可以查看 Agent 的思考步骤、工具调用及系统提示词,并附有中文翻译,便于学习。
DeepSeek Harness 发布了,带有轨迹模式,可以可视化 Agent 的思考步骤、工具调用和返回结果,并用颜色区分不同类型内容。可通过 npm 安装使用,适合开发者观察 Agent 工作进展。
OpenAI 推出 GPT-5.6,这是一个新的模型系列,以极低的成本提供前沿水平的智能体性能,并新增了用于推理持久化、多智能体编排和程序化工具调用的 API 原语。