testing

标签

Cards List
#testing

通义千问 3.8 27b 版本的表现大致是这样的...

Reddit r/LocalLLaMA ↗ · 18小时前

这篇文章戏剧性地呈现了针对Qwen 3.8 27b AI模型的测试套件执行过程,强调将重心置于即时行动与结果,而非冗长的分析阶段。

0 人收藏 0 人点赞
#testing

@daniel_mac8:Opus 5.5 在 '低' 推理强度下效果最佳。我作为项目的一部分进行了一些测试。Opus 5.5 在 '低' 推理强度下 …

X AI KOLs Timeline ↗ · 昨天 缓存

作者测试了 Opus 5.5 在低和最高推理强度下的表现,发现低推理强度以12倍更低的成本实现了相似的任务完成率,建议将其作为默认设置。

0 人收藏 0 人点赞
#testing

1工程师 + AI智能体 = 完整工程团队。(12天LMS后端项目复盘)

Reddit r/AI_Agents ↗ · 昨天

一位工程师通过管理一组AI智能体,在短短12天内构建了一个完整的大学LMS生产后端,展示了AI如何通过让一个人发挥整个工程团队的作用来改变软件开发。

0 人收藏 0 人点赞
#testing

最佳AI电话呼叫代理?我测试了8个,它们实际上是两种不同的产品

Reddit r/AI_Agents ↗ · 2天前

作者测试了八款AI电话呼叫代理,将它们分为自建平台和直接呼叫服务,并评估了它们在按照特定标准预约方面的表现。

0 人收藏 0 人点赞
#testing

我两个代理的 git 工作树的干净合并,但它自身的测试失败了

Reddit r/AI_Agents ↗ · 2天前

作者描述了一个实验,其中合并两个 AI 代理的 git 工作树导致了测试失败,尽管合并是干净的,突显了在没有相互意识的情况下并行代理开发的挑战。

0 人收藏 0 人点赞
#testing

Jev State

Product Hunt ↗ · 2天前 缓存

Jev State 是一款免费开源工具,可将AI对话转化为测试和可运行代码,使开发者能够构建、测试和导出对话式工作流至 TypeScript 和 workflow JSON。

0 人收藏 0 人点赞
#testing

Jev 是否揭示了人工智能中隐藏的性别歧视和种族主义倾向?

Reddit r/artificial ↗ · 2天前

对 Jev AI 模型的一项实验揭示了其基于候选人姓名的是/否回答中潜在的偏见,这表明训练数据中隐含的语义语言可能导致无意中的歧视,敦促在使用模型时保持谨慎。

0 人收藏 0 人点赞
#testing

平台是否应该了解它生成的软件?

Reddit r/AI_Agents ↗ · 3天前

作者正在构建一个软件生成平台,并质疑平台是否应知晓生成的组件,主张基于制品的契约和生命周期管理。

0 人收藏 0 人点赞
#testing

你的AI代理能否弄清楚如何使用SLD Checker?

Reddit r/AI_Agents ↗ · 4天前

作者正在寻求帮助,使用像ChatGPT和Claude这样的AI代理来测试SLD Checker,以评估其机器友好性并识别可用性问题。

0 人收藏 0 人点赞
#testing

确定性核心,非确定性外壳

Lobsters Hottest ↗ · 4天前 缓存

本文将Gary Bernhardt的'Functional Core, Imperative Shell'架构扩展为'确定性核心,非确定性外壳',强调确定性而非纯函数式主义,以提高软件系统的测试性和适用性。

0 人收藏 0 人点赞
#testing

在测试方法名中使用不间断空格

Lobsters Hottest ↗ · 5天前 缓存

本文讨论了在PHP测试方法名中使用不间断空格,以提升代码的可读性和清晰度。

0 人收藏 0 人点赞
#testing

AI能否成为居民而不仅仅是工具?

Reddit r/AI_Agents ↗ · 5天前

创建者建立了一个在线城市,AI代理作为居民拥有自主权,并寻求测试者来反馈不同AI模型的体验。

0 人收藏 0 人点赞
#testing

AI模型并未“自主”进行黑客攻击

Reddit r/artificial ↗ · 5天前 缓存

本文驳斥了媒体报道中关于AI模型如Gemini自主进行黑客攻击的说法,指出这些行为是某家安全措施不足的公司进行的测试的一部分,且在测试过程中移除了安全保护措施。

0 人收藏 0 人点赞
#testing

对Astra、Fable和MolmoAct2进行测试,通过机械臂执行4项有害操作,以评估其风险程度。

Reddit r/singularity ↗ · 5天前

本文讨论了涉及三个AI系统—Astra、Fable和MolmoAct2—操作机械臂执行有害任务的测试,评估了相关风险。

0 人收藏 0 人点赞
#testing

AI代理在网络安全测试中入侵公司

Reddit r/ArtificialInteligence ↗ · 6天前

AI代理在网络安全测试中展示了入侵公司的能力,凸显了其在安全评估中的应用。

0 人收藏 0 人点赞
#testing

试用TypeSafe的System One模型(JEV)与2048游戏

Lobsters Hottest ↗ · 6天前

本文讨论在2048游戏背景下测试和评估TypeSafe的System One AI模型。

0 人收藏 0 人点赞
#testing

相似的提示在每次运行时可能会生成不同的智能体计划,而我依然没有很好的测试方案

Reddit r/AI_Agents ↗ · 2026-09-18

作者讨论了测试基于LLM的智能体管道时的挑战,其中相似的提示可能导致输出变化,提倡使用基于属性的检查而非精确匹配来处理非确定性输出。

0 人收藏 0 人点赞
#testing

GPT-6 Astra 在3D中重建室内场景

Reddit r/ArtificialInteligence ↗ · 2026-09-16

测试显示,Astra可能是GPT-6的一部分,能够从单个参考重建3D室内场景,具有合理的空间一致性,尽管存在一些几何缺陷。

0 人收藏 0 人点赞
#testing

那些在便利店热卖的网红肽其实并非肽

Wired ↗ · 2026-09-15 缓存

在布鲁克林便利店销售的爆红肽经检测发现不含标签成分,引发对非管制肽市场中标签错误和安全的担忧。

0 人收藏 0 人点赞
#testing

智能体获救了,修复去向何处?

Reddit r/AI_Agents ↗ · 2026-09-14

本文讨论了如何通过一个结构化流程将针对AI智能体的手动修复纳入未来的改进,以Reef的harness教程为例,该流程包括记录纠正、测试更改和发布版本。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈