本文へスキップ

すべてのメニュー

Heretic

言語モデルの検閲を自動で取り除くツール

その他21日前
カテゴリー
その他
ウェブサイト
github.com
言語
英語
登録日
21日前
スター
31,908
フォーク
3,576

p-e-w/heretic ↗, Python, AGPL-3.0, 最終コミット 1日前

Heretic はトランスフォーマー系の言語モデルから安全アライメントを、事後学習なしで取り除きます。一般に abliteration と呼ばれる方向的アブレーションに Optuna ベースの TPE パラメータ最適化を組み合わせ、拒否応答の数と元の重みからの KL ダイバージェンスを同時に最小化する設定を探します。二つの目的を一緒に下げるため、能力を大きく損なわないまま検閲だけが外れ、探索に人手が要りません。Python 製、AGPL-3.0 です。

この製品が気に入りましたか?