跳到主要內容

全部選單

Heretic

自動移除語言模型審查的工具

其他21天前
分類
其他
語言
英語
發布於
21天前
複刻
3,576

p-e-w/heretic ↗, Python, AGPL-3.0, 最近提交 1天前

Heretic 能在不做任何後訓練的情況下,把 Transformer 語言模型裡的安全對齊拆掉。它把一般稱為 abliteration 的方向性消融,與基於 Optuna 的 TPE 參數最佳化結合起來,尋找同時讓拒答次數與相對原始權重的 KL 散度都降到最低的設定。因為兩個目標一起下降,模型在去掉審查之後仍保留大部分原有能力,整個搜尋過程也不需要人工調參。Python 撰寫,AGPL-3.0 授權。

喜歡這個產品嗎?