跳到主要内容

全部菜单

Heretic

自动移除语言模型审查的工具

其他21天前
分类
其他
语言
英语
发布于
21天前
复刻
3,576

p-e-w/heretic ↗, Python, AGPL-3.0, 最近提交 1天前

Heretic 能在不做任何后训练的情况下,把 Transformer 语言模型里的安全对齐拆掉。它把通常称为 abliteration 的方向性消融,与基于 Optuna 的 TPE 参数优化结合起来,寻找同时让拒答次数与相对原始权重的 KL 散度都降到最低的配置。因为两个目标一起下降,模型在去掉审查之后仍保留大部分原有能力,整个搜索过程也不需要人工调参。Python 编写,AGPL-3.0 许可。

喜欢这个产品吗?