标签
Benzi是一个新型智能体框架,通过使用确定性智能最小化源代码读取,在SWE-bench等基准测试中以更低的令牌使用量和成本实现更好性能。
Datalab发布了Marker v2,这是一个开源的文档解析管道,可以高效地将PDF、图像、DOCX和PPTX文件转换为markdown,支持超过90种语言,并在GPU上表现出高性能。
VoiceStudio是一个本地运行的AI语音工具,提供语音克隆、声音设计、视频配音等功能,支持646种语言,无需网络连接或订阅,数据完全在本地处理。
Liquid AI的LFM2.5-Encoders能够在一次处理中识别并剥离16种语言的40种个人身份信息,专为在私有管道中进行安全AI数据处理而设计。
Cursor 开源了 SDK Bridge,这是一种基于 protobuf 的协议,允许开发者用任何语言(例如 Rust、Go、Java)构建 Cursor 智能体,而无需依赖官方的 TypeScript 或 Python SDK。
Fish Audio 推出S2.1 Pro,这是一款生产级语音模型,具有90毫秒延迟,支持83种语言,可从短样本进行语音克隆,并支持多人对话,可通过API使用,并设有开发免费套餐。
中国开源了仅3B参数的OCR模型Unlimited-OCR,能一次性解析整个100页PDF,支持本地运行,准确率93%,完全免费开源。
黑客Vitto Rivabella公开宣布成功越狱Fable 5,详细分析了模型的多层安全防护机制,包括输入输出审核、意图检测和链式思维防御,并给出了绕过方法。
RoadmapBench提出了一个包含115个长期编码任务的新基准,这些任务跨越17个代码库和5种语言,要求代理实现多目标版本升级。对13个前沿模型的评估显示,即使是最优的Claude-Opus-4.7也只能解决39.1%的任务,突显出长期软件开发在很大程度上仍未得到解决。
Fusion 是一种编程语言,允许开发者一次编写库,并从单一代码库转译到 C、C++、C#、D、Java、JavaScript、Python、Swift、TypeScript 和 OpenCL。
有道开源了1.3B参数的Confucius4-TTS模型,支持14种语言的零样本语音克隆与跨语言语音合成,速度快且效果优秀。
Multi-LCB 将 LiveCodeBench 基准扩展到十二种编程语言,以评估大型语言模型,同时保留污染控制机制,揭示了 Python 过拟合和语言特定的污染问题。
A new AI tool automatically reads web page content, generates scripts, and creates full videos with narration, subtitles, and BGM, then adapts them into multiple languages and sizes for different platforms, solving the pain point of repetitive editing for cross-border content creators.
一个从真实生产代码(如React、Linux内核、Go、Redis等)中提取的46个编程模式参考库,每个模式配有交互式可视化、精确到行的源码链接以及TypeScript/Python/Go/Rust四种语言的实现和可运行练习。站点中英文双语,支持搜索和分类浏览。
Diplomat 是一个多语言单向 FFI 工具,用于封装 Rust 库,旨在将 Rust API 暴露给 C++、JS、Dart 和 JVM 等语言,而无需 FFI 专业知识,填补了 Rust 工具生态系统中的空白。
PaddleOCR 发布 PP-OCRv6,全新的 OCR 模型系列,参数量从 1.5M 到 34.5M,提供更高的精度和更快的推理速度,支持 50 种语言以及 PCB、CAD 图纸等新场景,采用 Apache 2.0 开源许可证。
CodeAlchemy 是一个合成数据生成框架,通过五种策略将公开可用的代码转换为语义丰富的训练数据,生成超过5000亿个 token,使得小型模型在代码基准测试上超越大得多的模型。
介绍了一个开源的语音合成模型,20亿参数、200万小时训练,支持30种语言和9种中国方言,可用自然语言描述音色,3秒录音即可克隆声音,音质达48kHz,Apache-2.0协议免费商用。
微软发布了 MAI-Voice-2,这是一款支持 15 种语言语音克隆的表现力丰富的文本转语音系统。