- 語言
- 英語
- 發布於
- 21天前
- 複刻
- 3,576
p-e-w/heretic ↗, Python, AGPL-3.0, 最近提交 1天前
Heretic 能在不做任何後訓練的情況下,把 Transformer 語言模型裡的安全對齊拆掉。它把一般稱為 abliteration 的方向性消融,與基於 Optuna 的 TPE 參數最佳化結合起來,尋找同時讓拒答次數與相對原始權重的 KL 散度都降到最低的設定。因為兩個目標一起下降,模型在去掉審查之後仍保留大部分原有能力,整個搜尋過程也不需要人工調參。Python 撰寫,AGPL-3.0 授權。