标签
Andrej Karpathy 分享了高效理解大模型海量输出的实用技巧:用 ASD-STE100 受控语言约束文本、生成图表与架构图、构建可交互 HTML 页面进行参数探索,以及制作 3Blue1Brown 风格的讲解视频——当「一次性软件」的成本趋近于零时,这些方法尤为实用。
新研究发现,将 AI 用作思考的替代品会削弱解决问题的能力,而将其用作辅导老师,则比完全依赖 AI 获取答案以及完全不使用 AI 的人都取得了更好的效果。
本文探讨了专注于任务完成的AI智能体与能与用户发展共享上下文的AI伙伴之间的区别,认为伙伴更符合人类的需求。
作者分享了构建OSIO的见解,OSIO是一个用于企业中人机协作的操作系统,主张组织应置于单个AI代理之上,以管理能力、权限和记忆。
作者倡导设计能增强人类思维和创造力而不取代人类的AI代理,强调在代理环境中保留问题解决和学习能力的重要性。
Marina Pasqual 描述了为AI代理设定明确边界如何提升其在社区增长等运营任务中的实用性,确保关键决策仍由人类判断。
本文探讨了在人类-AI协作中,当贡献变得不可区分时,责任归属所面临的挑战,使得判断责任的分配复杂化。
本文提出 SCALE,一种顺序成本感知的假设检验策略,该策略利用 AI 判断并辅以选择性的人工验证,在控制错误率的同时最小化成本,可应用于软件可靠性评估等场景。
构建者介绍了MuseFM,一个AI代理与人类共存的社区平台,并征求关于为代理构建空间以实现自主参与的反馈,讨论了诸如垃圾信息和内容等潜在问题。
Ando 推出一款团队通讯应用,将 AI 代理集成为活跃参与者,旨在取代像 Slack 这样的传统平台,消除团队沟通中的人类中介。这家初创公司已从包括 Accel 和 Index Ventures 在内的投资者那里筹集了2000万美元的种子前和种子轮融资。
论文研究了来自13家供应商的60种语言模型在用户施压时的行为,发现折叠率与模型的新颖程度相关,而持守方式因供应商而异。此外,研究表明LLM编码器能够一致地应用人类编写的代码手册,表明人类应专注于定义行为而非标注数量。
一位软件工程师将Claude描述为他的联合创始人,引发了关于在软件开发中人性化AI工具的讨论。
本文介绍了一个以生产力为导向的框架,用于评估人机协作,该框架基于相对于交互成本的结果质量。研究表明,相同质量评分在交互成本上可能存在显著差异,且主观用户评分对于衡量生产力并不可靠。
本文探讨了呼叫中心的人工智能工具,如通话摘要和工单路由,是否真正减少了坐席的工作量,还是仅仅通过更多的监控和目标增加了压力。
一项系统映射研究,分析了人类、引擎和语言模型在国际象棋研究中的应用,以识别战略推理中的差距和未来方向。
一位经验丰富的开发者分享了有效使用AI编码代理的7个关键见解,强调需要战略背景、文档记录和人工监督以获得更好结果。
本文探讨了人类在AI辅助软件开发中的角色,强调在基础AI提示之外,人类专业知识至关重要,这在将Postgres用Rust重写以提升性能等项目以及作者自己的AI编排系统中得到了体现。
本文讨论了像GPT-6 Astra这样的AI模型如何通过高级代理使独立创始人能够处理多个商业角色,将竞争优势从团队规模转向AI协调能力。
本文讨论了有效使用AI与重新设计工作流程以融入AI之间的区别,强调真正的自动化需要全面的流程设计,包括触发器、输入、验证、异常处理和人类决策边界。
Atria Dawn Preview 是一个基础代理型语言模型,专为科学研究设计,取得了有竞争力的基准测试结果,并展示了向人类-AI项目级协作的转变。