标签
Chris Barber发起的一项投票根据已知的人才密度对公司进行排名,Cognition和Anthropic并列第一,紧随其后的是Modal、OpenAI等。
Cognition 发布了 SWE-1.7,一个功能强大的 AI 模型,专为智能体软件工程设计,以更低的成本实现了前沿级别的性能。该模型在强化学习训练、多集群基础设施、数据整理以及针对长任务的自我压缩方面进行了改进。
Anthropic的新研究发现语言模型中存在一个类似于人类大脑意识处理的'全局工作空间',发现了一个类似于意识和无意识思维的分界。
Cognition与Grant Sanderson(3Blue1Brown)举办了一场炉边谈话,探讨如何让抽象概念变得易于理解,以及智能与设计将如何共同发展。
Cognition 推出了 Devin Security Swarm,这是一个利用 Agentic MapReduce 架构发现安全漏洞的新工具,相比替代方案准确率更高、成本更低。
本文讨论了Devin的新功能'Security Swarm',它使用Agentic MapReduce来扩展AI驱动的代码安全分析,说明了未来需要100倍AI推理的原因以及在各行业中战略部署多样化模型的重要性。
智谱创始人唐杰老师分享文章,讨论AI时代中认知、格局、技术、管理的重要性排序:认知 > 格局 > 技术 > 管理。
本文提出一个扩展的疏散框架,将认知、情感、社交和人格机制整合到基于智能体的不确定性人类行为仿真中。该框架建模动态事件意识、记忆、恐惧以及基于OCEAN的人格,展示了其对疏散效率和真实人群现象的影响。
本文介绍了一种张量网络模型,用于捕捉情绪效价对儿童识别记忆顺序依赖结构的影响,达到了77.98%的准确率,展示了量子启发方法在建模认知现象中的价值。
Cognition推出Devin Fusion,这是一款自适应模型路由器,可在保持真正前沿智能用于代理编程任务的同时,将成本降低35%。
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。
Cognition 为 DevinAI 正式启动大使计划,面向全球招募 50 位新大使,入选者可获得免费的 Devin Max 计划、积分和早期访问权限。
Cognition 将域名从 cognition.ai 迁移至 cognition.com,Devin 仍是首个自主软件工程师。
FrontierCode 是 METR 和 Cognition 推出的新编程基准,用于评估 AI 模型在代码可维护性和质量方面的表现,结果显示许多模型会生成无法合并的代码。该基准包含超过 1000 小时的工作量,并表明即使顶尖模型也难以应对,其中 Opus 4.8 在最难的等级上仅获得 13.8%。
Cognition 推出了 FrontierCode,这是一个高质量的编程基准测试,超越了单纯的单元测试,用于衡量代码的可维护性、回归安全性和质量,由 20 多位开源开发者精心设计了 150 个任务。
讨论AI采用中从基于token的生产力指标转向产出、影响和价值衡量,重点介绍Cognition的解决方案:自适应路由、支出归因、自动化以及生产力保障。
Cognition发布了Devin的首个评估套件,提供长达100小时的企业级评估并附有财务保证。数据集包含来自126家企业用户的真实Java/TypeScript/Python/C#任务,旨在比现有基准更准确地衡量工程生产力。