- 语言
- 英语
- 发布于
- 21天前
- 复刻
- 3,576
p-e-w/heretic ↗, Python, AGPL-3.0, 最近提交 1天前
Heretic 能在不做任何后训练的情况下,把 Transformer 语言模型里的安全对齐拆掉。它把通常称为 abliteration 的方向性消融,与基于 Optuna 的 TPE 参数优化结合起来,寻找同时让拒答次数与相对原始权重的 KL 散度都降到最低的配置。因为两个目标一起下降,模型在去掉审查之后仍保留大部分原有能力,整个搜索过程也不需要人工调参。Python 编写,AGPL-3.0 许可。