标签
Android Bench 2.0是一个更新的AI评估框架,用于评估模型在Android的长周期工程任务上的表现,例如从零开始构建应用程序和迁移代码库,并采用持续评分机制。
供 AI 代理使用的 skills 集合,在 GitHub 上拥有超过 82,000 颗星,由 Addy Osmani 创建,涵盖从 spec 到 ship 的工程流程,并兼容 Claude Code、Cursor 和 Codex。
一位独立开发者介绍了TigrimOSR,这是一个Rust原生桌面应用,集成了聊天、文件、终端、任务和多智能体编排,为工程决策提供结构化工作流,旨在减少智能体AI的随机性。