全球开源大模型生态迎来架构层面的颠覆性突破。谷歌于6月3日正式发布了全新统一多模态模型
在传统的多模态架构中,模型通常需要依赖独立的视觉和音频编码器,将图像和声音信号转换为与文本Token相匹配的维度,这在无形中增加了模型的体积与计算复杂度。而
得益于底层架构的瘦身,这款拥有120亿参数的高性能模型被完美压缩在消费级硬件的运行门槛之内。开发者或普通用户仅需16GB的显存或统一内存,就能在高端笔记本电脑上直接本地部署并流畅运行。这意味着用户无需依赖昂贵的云端算力,便能离线处理复杂的视觉和音频任务。
在实际性能表现上,
发表评论取消回复