标签
展示了通过在图像上优化以最大化目标描述的概率,在现代LLM上产生的深度梦境效果;Gemma 12B(无视觉编码器)在画布上印出可识别的物体,而E4B(有视觉编码器)则漂移为纹理。
开发者将Gemma 4 E4B在Google LiteRT引擎上的表现与Q4 GGUF量化版本进行对比,发现由于多令牌预测(MTP),文本生成速度提升约2.4倍,但图像描述仅提升1.1倍。文章提供了一个面向OpenAI兼容端点的Python封装,但存在确定输出、单会话引擎等限制。
作者提出一种方法,将E4B音频编码器添加到更大的模型中,通过提取编码器、创建线性投影层,并仅使用文本-音频对微调该层,类似于参考论文中的方法,但使用Gemma而非Whisper。