LensVLM-9B是苹果公司开发的一个拥有90亿参数的视觉语言模型,它能扫描压缩的文本图像,并利用学习到的工具选择性地展开相关页面,同时提供了论文、代码和使用说明。
Black Forest Labs发布了FLUX 3 Action,这是一组面向机器人的70亿参数AI模型,包含基础模型以及适用于SO-101和DROID的控制策略,已在Hugging Face平台上线。
Google 推出 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,这些新的文本转语音模型可让创作者和开发者生成富有表现力且可定制的音频。
DrivingBench 评估前沿AI模型(如GPT-6 Astra)能否通过控制一辆丰田卡罗拉在预定义路线上驾驶真实汽车,并追踪诸如进度、距离和token成本等指标。
名为 Space Bunny 的秘密多模态 AI 模型已在 OpenCode 中发布,可免费试用,发布公司未知
发布了 Qwen 3.8 27B AI 模型的高质量量化版本,声称在质量测试中超越了 ISTA 和 Unsloth 量化版本。
一条推文预测,一个名为 Opus 5.5 的 AI 模型将在大约六个月内达到指定的智能水平,并从开源实验室中可用。
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
GPT-6 Astra在ZeroBench这个极其困难的视觉基准测试上取得了巨大飞跃,在所有三个指标上超越了人类基线。
GPT-6 Sol 和 Claude Opus 5.5 以远低于前代产品的成本和时间实现了接近前沿的性能,突显了显著的效率提升。
Open-Jev-27B-v1.1 是一个开源 AI 模型,配备 LoRA 适配器,在 JevBench 上达到 85.28% 的准确率,并具有各种任务的交互式演示。
最新的远程劳动力指数结果显示,GPT-6 Astra模型能够自动化20.8%的随机远程项目,相比十月的2.5%有显著提升,凸显了人工智能自动化领域的快速发展。
GGUF量化版的Qwen-Image-2.1 AI模型已发布,采用Dynamic 2.0技术实现高效4位量化,支持文本到图像和透明图像生成,文件大小为4.2GB,适合Mac用户使用。
本文提供了 Engram 模型的更新,详细介绍了其 2.6b 参数架构,包括一个大型 Engram 表和初步训练进度达到 1 亿 token,展示了通过上下文感知数据卸载实现的改进补全效果。
Addy Osmani 赞扬 Opus 5.5 是一个更便宜、更快的 AI 模型,宣称它是他大多数工作任务的新日常主力工具。
有人抢先体验了 Opus 5.5,并用它创建了游戏项目,包括一个类似 Dark Souls 的项目,结果远超预期。
Claude Opus 5.5 在浏览器中生成了一个类似Minecraft的3D世界,具有程序化地形、动态光照、水和建筑元素。