2024-08-01 10:31:36.AIbase.10.7k
打开语言模型“黑箱”!Google DeepMind 发布一套可视化工具Gemma Scope
Google DeepMind的最新研究Gemma Scope揭开了语言模型黑箱的秘密,通过稀疏自编码器(SAEs)分解和重构语言模型的激活,旨在揭示背后有意义的特征。Gemma Scope采用JumpReLU SAEs,通过控制激活,优化重建损失并正则化活跃的潜在特征数量,以揭示语言模型的内部机制。研究发现,残差流SAEs的性能通常较低,序列长度对SAE性能有显著影响,不同数据集子集的表现各异,DeepMind mathematics上表现最佳。Gemma Scope的发布不仅有助于理解SAEs,还能改进实际任务性能,对SAEs进行红队测试,提高AI的可解释性和安全性。