跳到正文
arXiv AI· Razan El Mais, Ali Chehab, Ibrahim Issa, Razane Tajeddine·· 6 天前评分55

Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?

摘要

差分隐私随机梯度下降(DP-SGD)是用于保护隐私的大型语言模型(LLMs)微调的领先方法。许多解码器仅有的LLMs采用输入和输出嵌入之间的权重绑定,这一设计初衷是为了提高参数效率和非隐私设置下的语言建模性能。然而,不同隐私训练下权重绑定的影响仍缺乏深入研究。

推荐理由

请对照arXiv AI原文,核对完整说明及适用条件。

本站只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv AI · arxiv.org