pareto-frontier

标签

Cards List
#pareto-frontier

Cognition 推出新型 SWE-2 模型,与 Fable 5.1 和 GPT-Astra 相媲美

Hacker News Top · 6天前 缓存

Cognition 推出 SWE-2,这是一款先进的编码模型,以极低的成本实现了与 Fable 5.1 和 GPT-Astra 相竞争的性能,利用新型强化学习来优化成本效益前沿。

0 人收藏 0 人点赞
#pareto-frontier

Occamy-1.0:开源帕累托前沿35B协作智能模型

Hugging Face Daily Papers · 2026-09-04 缓存

Occamy-1.0是一个成本效益高的开源AI模型,专为协作代理设计,在复杂多步骤任务中表现出色,并与更大型的前沿系统具有竞争力,同时保持广泛的代理能力。

0 人收藏 0 人点赞
#pareto-frontier

Qwen3.8-Max-0902 在编码领域超越 Claude Opus 5

Reddit r/singularity · 2026-09-02 缓存

Qwen3.8-Max-0902 在 Code Arena: WebDev 中以 1691 分首次亮相排名第一,超越 Claude Opus 5 3 分,并以每百万代币 5 美元的价格占据了 Pareto frontier 上的最高分位置。

0 人收藏 0 人点赞
#pareto-frontier

MiniMax H3 Max(由 fal 在 MiniMax H3 上后训练)树立了视频生成的新 Pareto Frontier,速度比基础模型快近50倍。

Reddit r/singularity · 2026-08-26 缓存

MiniMax H3 Max 由 fal 在 MiniMax H3 上进行后训练,为视频生成树立了新的 Pareto Frontier,生成时间比基础模型快近50倍,在 image-to-video 和 text-to-video 任务中分别实现了18倍和24倍的速度提升。

0 人收藏 0 人点赞
#pareto-frontier

@Modular:Modular 在 @Zai_org 的 GLM-5.2(非推理)上的性价比正好处于 @ArtificialAnly… 的帕累托前沿

X AI KOLs Following · 2026-08-24 缓存

Modular 在 Zai_org 的 GLM-5.2 模型基准测试中表现出色,以接近顶级的速度实现了高性价比。

0 人收藏 0 人点赞
#pareto-frontier

@rohanpaul_ai: Meta的Muse Spark 1.2升至第4位,同时将Text Arena的成本-质量帕累托前沿向上推进。你只损失9分……

X AI KOLs Following · 2026-08-08 缓存

Meta的Muse Spark 1.2在Text Arena中升至第4位,通过降价约91%将成本-质量帕累托前沿向上推进,同时相比顶级模型仅损失9分。

0 人收藏 0 人点赞
#pareto-frontier

RAG-Stack:协同优化RAG服务性能与质量

arXiv cs.AI · 2026-08-06 缓存

本文介绍了RAG-Stack,一个通过高效探索算法-系统联合配置空间来协同优化RAG服务性能与答案质量的框架。它找到的Pareto前沿比现有配置搜索方法覆盖了显著更广的质量-性能空间。

0 人收藏 0 人点赞
#pareto-frontier

学习分布偏移下预测模型的帕累托前沿

arXiv cs.LG · 2026-08-04 缓存

本文提出了前沿学习(Frontier Learning)框架,该框架结合多个黑盒和白盒预训练模型的表示与预测,构建统一的目标域表示,并保证在分布偏移下性能不劣于任何单一复用基线。在视觉域适应和临床死亡率预测上的评估显示,该方法相较强基线持续获得增益。

0 人收藏 0 人点赞
#pareto-frontier

@bageldotcom:我们正在发布WorldDiT,一个用于机器人世界建模与控制的统一架构。在LIBERO基准测试中,它……

X AI KOLs Following · 2026-07-28 缓存

WorldDiT是一个用于机器人世界建模与控制的统一架构,在不依赖VLM生成动作的方法中,它在LIBERO基准测试上取得了最佳性能,并位于所报告的帕累托前沿上。

0 人收藏 0 人点赞
#pareto-frontier

@elonmusk:Grok 4.5和Opus 5独自位于帕累托前沿

X AI KOLs Following · 2026-07-24 缓存

埃隆·马斯克声称,Grok 4.5和Opus 5是唯一两个在性能和效率上位于帕累托前沿的AI模型。

0 人收藏 0 人点赞
#pareto-frontier

YUKTI: 从自然语言情境到鲁棒、可验证的决策——一种不确定性类型化的命题图、假设鲁棒帕累托前沿以及遗憾证书

arXiv cs.AI · 2026-07-14 缓存

本文介绍了YUKTI框架,该框架通过使用不确定性类型化的命题图、带有遗憾边界的假设鲁棒帕累托前沿以及多阶段优化交接,将自然语言决策情境转化为鲁棒、可验证的决策。在合成数据集和真实数据集上的验证表明,与朴素点解方法相比,它显著降低了遗憾,并揭示了语言模型推理的局限性。

0 人收藏 0 人点赞
#pareto-frontier

@AnjneyMidha:传统资本主义的一个有趣性质是,企业往往不得不在规模与文化之间做出选择,但…

X AI KOLs Following · 2026-07-09 缓存

一个观察:人工智能使小团队能够在保持文化的同时实现收入的指数级增长,从而在商业中创造一个新的帕累托前沿。

0 人收藏 0 人点赞
#pareto-frontier

@zihengh1: LLM-as-a-judge 现在在自动评估中无处不在。但它可能缓慢、昂贵且不透明。如果我们问...

X AI KOLs Timeline · 2026-07-02 缓存

介绍 PAJAMA,一种混合评估系统,通过提取评分标准并以编程方式执行,改进了 LLM-as-a-judge 方法,推动了速度、成本和透明度的帕累托前沿。

0 人收藏 0 人点赞
#pareto-frontier

Show HN: MiniPCs.zip – 绘制迷你PC的帕累托前沿

Hacker News Top · 2026-06-20

一个名为MiniPCs.zip的网站,通过基准测试对数千款迷你PC进行绘图,并揭示帕累托前沿,以帮助用户获得每美元最高的计算性能。它使用Gemini从列表信息中提取规格。

0 人收藏 0 人点赞
#pareto-frontier

SwiftCTS:基于少样本校准的跨设计快速预测与时钟树指标帕累托优化

arXiv cs.LG · 2026-06-11 缓存

SwiftCTS是一个物理信息代理框架,利用梯度提升集成和少样本校准,快速预测并帕累托优化未见设计上的时钟树指标(功耗、线长、时钟偏移),以极少的训练数据实现高精度。

0 人收藏 0 人点赞
#pareto-frontier

树上的智能体:面向多目标分子优化的路径协调

arXiv cs.AI · 2026-06-02 缓存

ATOM是一个多智能体框架,将分子优化建模为树状搜索,沿路径布置专门化的智能体,从而能够探索替代分子轨迹并在多目标基准测试中提高帕累托覆盖率。

0 人收藏 0 人点赞
#pareto-frontier

当云代理遇上设备代理:混合多智能体系统的经验教训

Hugging Face Daily Papers · 2026-05-28 缓存

本文系统研究了结合云端LLM与端侧SLM的混合多智能体系统,揭示了任务依赖的最优架构,并挑战了“更多前沿算力总是能提升性能”的假设。

0 人收藏 0 人点赞
#pareto-frontier

OpenBMB 发布 MiniCPM5-1B 大语言模型。目前同尺寸下最强大的大语言模型之一。(在 Artificial Analysis Intelligence Index 上得分为 17.9)

Reddit r/singularity · 2026-05-27 缓存

OpenBMB 发布 MiniCPM5-1B,这是一款领先的 1B 参数开源权重大语言模型,在同尺寸类别中取得了 Artificial Analysis Intelligence Index 最高分(17.9),超越了 Qwen3.5 2B 等更大模型,而使用的参数更少。

0 人收藏 0 人点赞
#pareto-frontier

@maxxxzdn:今天我们发布了Mosaic,一个概率天气模型,它推动了机器学习天气预报的帕累托前沿。

X AI KOLs Following · 2026-05-20 缓存

Mosaic是一个概率天气模型,其预报技巧与最先进的模型相当,同时在单个H100上能在12秒内生成24个成员的10天全球预报。

0 人收藏 0 人点赞
#pareto-frontier

评估客服聊天代理系统的笔记:启发式评估器给出虚假信号,检索错误伪装成LLM失败,成本/质量的帕累托前沿往往不在你想的地方 [D]

Reddit r/MachineLearning · 2026-05-15

审计生产级客服RAG系统的实际发现:启发式评估器给出虚假信号,检索错误常伪装为LLM失败,成本与质量的帕累托前沿往往不在预期位置。模型扫查显示,用Gemma 4 26B替换原有模型(Gemini Flash Lite Preview)可在成本降低79%的同时实现19%的质量提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈