【アンセンサードLLM最前線 #116】Abliteration.AI——アンセンサードモデルへのアクセス販売が開始
Abliteration.AIが動かし始めた「検閲なきモデル市場」の衝撃
アンセンサードモデルをめぐる動きに、新たな商業的な流れが加わりました。The Tech Buzzの2026年9月3日付の報道によると、Abliteration.AIがアンセンサードモデルへのアクセスを販売しているといいます。従来、検閲を取り除いたモデルは、研究やコミュニティベースの作業の中で個別に入手するのが普通でした。それを事業者が販売という形で提供するというのは、アンセンサードモデルが一部の愛好者のものではなく、ひとつの市場として成立し始めたことを示す出来事だと言えます。アクセスの販売という形式には、利用者が自身でモデルを加工・管理する手間を省けるという利点がある一方で、提供されるモデルの中身や品質は販売元に依存します。abliterationはアライメントを機械的に解除する手法であり、処理の仕方によってモデルの挙動が変わり得るため、利用する側は何がどのような状態で提供されているのかを確認する姿勢が重要になるはずです。また、この報道と前後して、Hereticを用いてabliteratedモデルを構築する手法を解説する記事も公開されています。つまり、購入して使う道と、自分で構築する道の両方が現れたことになります。セーフティフィルタを除去したモデルをめぐる動きが、技術面と商業面の両輪で広がりを見せているいま、ローカルLLM実践者にとっては、その意味と扱い方を見極める時期に来ているといえるでしょう。

挿絵
abliterationの仕組み——セーフティフィルタはどう取り除かれるのか
abliterationとは、学習済みモデルに組み込まれた拒否反応——「これはお答えできません」というセーフティフィルタの挙動を、再学習なしで取り除く手法です。元のモデルの重みをそのまま使い、拒否に関係する方向だけを弱める点が特徴です。
仕組みを一般論として整理します。LLMの内部では、有害と判断される入力に対して「拒否」を引き起こす特定の特徴方向が存在するという知見が基盤にあります。まず通常のモデルに有害な指示と通常の指示をそれぞれ入力し、各層の内部状態の差分を集計して拒否方向を推定します。そのうえで、推論時にこの方向へ向く成分を選択的に打ち消します。重みを書き換える方式と、生成時の内部状態へ介入する方式の両方が知られています。
利点は、ファインチューニングのように大量のデータやGPU時間を要しない点です。差分の測定と方向の推定だけなら手持ちの環境でも実行可能とされています。一方で、推定が不十分だと通常の会話能力まで損なうことがあり、どこまで除去するかの加減が品質を左右します。残留挙動が出る場合もあるため、適用後には拒否の残り具合と一般性能の両方を確認するのが現実的な進め方です。
2026年9月3日付のThe Tech Buzzの報道によれば、Abliteration.AIがこうしたアンセンサードモデルへのアクセスを販売しているとされ、セーフティフィルタを除去したモデルをめぐる動きが広がりを見せています。技術的には「拒否を支える内部表現を特定し、弱める」というシンプルな発想に立脚しており、だからこそ幅広いモデルに応用しやすいと言えるでしょう。

挿絵
Hereticで自作するabliteratedモデル、何が新しいのか
abliteratedモデルを入手する道は、これまでは原理を理解した上で自分の手で処理を実行するか、すでに公開済みのモデルを探してくるかのどちらかが主な道でした。そんな中で注目されているのが、Hereticというツールを使ってabliteratedモデルを自作するという手法です。この手法を解説する記事が公開されており、セーフティフィルタ除去モデルをめぐる動きが広がりつつあります。
何が新しいのかを整理すると、まず「自作できる」こと自体が意味を持ちます。公開済みのモデルは、ベースとなるアーキテクチャやサイズが作者任せです。しかし自分で構築すれば、手持ちのローカル環境で動かしたいモデルを対象に選ぶことができます。ローカルLLM実践者にとっては、利用したいモデルと除去処理の組み合わせを自分で決められる点が魅力だと考えられます。
また、ツールとして整備されていることで、abliterationが一部の熟練者だけの特殊な技術ではなくなりつつある点も見逃せません。手順が文書として公開されていることは、手法の再現性が高まっていることの表れでもあります。これは提案ですが、まずは解説記事の内容を理解した上で、小さなモデルで手順を一通り追ってみるのが安全な第一歩ではないでしょうか。
もっとも、自作できることと安易に使ってよいことは、別の話です。次の節で触れる実践の進め方や、その先にある危険性の話は、この手法を試す前にぜひ押さえておきたいところです。

挿絵
ローカルLLM実践者は今日これをどう試せるか
今日これを試すには、いくつかの入口があります。まず、Abliteration.AIがアンセンサードモデルへのアクセスを販売しているとThe Tech Buzz(2026年9月3日付)が報じていますので、手元でモデルを構築する前の比較対象として、その提供形態を確認してみるとよいでしょう。何がどのような条件で使えるのかを見ておくだけでも、自分のワークフローに合うかどうかの判断材料になりますし、自前構築のコストと見比べる基準にもなるはずです。
もう一つの入口は、自分でabliteratedモデルを作る道です。Hereticを用いてセーフティフィルタを除去したモデルを構築する手法を解説する記事がすでに公開されており、手順の全体像は外部の情報からたどれます。ローカル環境で動かす実践者であれば、まずは小ぶりのモデルで一連の流れを通してみるのが現実的だと思います。これはあくまで筆者からの提案であり、環境や目的に応じて読み替えてください。
試す際には、出力の傾向が除去前とどう変わるかを、普段使っているプロンプトで比べて記録しておくと、自分の用途への適性が見えやすくなります。同じ入力に対する応答を並べておくだけでも、違いは意外とはっきり現れるものです。ただし、フィルタがないモデルは拒否しない応答をそのまま返しうるため、試験は閉じた環境で行い、生成物の扱いには十分な注意を払ってください。セーフティフィルタ除去モデルをめぐる動きが広がりつつあるからこそ、情報の出所を確かめながら、一歩ずつ確認していく姿勢が重要です。

挿絵
鋭くなった刃の危険性——限界と法的・倫理的注意点
abliterationによってセーフティフィルタが取り除かれたモデルは、いわば刃が鋭くなった道具です。利用の幅が広がる一方で、リスクも比例して高まる点を見過ごせません。
まず技術的な限界として、セーフティフィルタの除去は完璧な手術ではありません。拒否応答を担う方向を調整する手法である以上、モデルの通常の推論能力に意図しない影響が残る可能性は一般論として指摘されています。フィルタが消えたからといって、モデルが正確になったわけではない点は押さえておく必要があります。
次に法的な側面です。日本では、犯罪の教唆や不正アクセス、個人情報の取得など、モデルの出力をどう使うかで法令が問題となります。モデル自体の検閲がなくなっても、利用者の行為が免責されるわけではありません。これは一般論ですが、アンセンサードモデルでは通常モデルなら止まっていた出力がそのまま生成されうるため、利用者自身が線引きを担うことになります。
倫理的な注意点としては、他者を攻撃する目的の文章生成や、要配慮個人情報の取り扱いへの関与は、提案として明確に避けるべきだと述べておきます。加えて、出力の真偽を利用者が必ず検証する運用が望まれます。
The Tech Buzz(2026年9月3日付)が報じたAbliteration.AIによるアンセンサードモデルへのアクセス販売は、こうした技術への障壁を下げる動きです。アクセスの容易さが高まるからこそ、Hereticでabliteratedモデルを構築する手法が解説されるといった動きと同様に、技術の民主化と利用者の自己責任は必ずセットで考えるべきだと考えます。
検閲なきモデルは何を照らし出すか
セーフティフィルタを取り除いたモデルが商業的なサービスとして販売され、その構築手法まで公開される——こうした動きは、単なる規制回避の技術流行にとどまらず、私たちがAIに何を求めているのかを映し出す鏡になると考えます。これはあくまで筆者の見立てですが、通常のモデルが答えを控える領域には、悪用目的の情報だけでなく、医療や心理などデリケートな話題への真剣な問いも含まれています。検閲なきモデルの需要が広がっているという事実は、既定のフィルタがどこかで人々の正当な知的要求まで遮ってしまっている可能性を示唆しているのではないでしょうか。
実際、Abliteration.AIがアンセンサードモデルへのアクセスを販売していると報じられ(The Tech Buzz、2026年9月3日付)、Hereticを用いてabliteratedモデルを構築する手法を解説する記事も公開されています。つまりこれは一部の技術者の遊びではなく、アクセスが商品として、手法が教程として流通する段階に入ったということです。検閲の除去が実験室の中の話から、誰もが手に取れる商業的提供へと移行しつつある点は、見過ごせない変化です。
一般論として、アライメントの強さは開発者側の価値判断の産物であり、それを取り除く行為は、その判断を利用者個人の責任に引き取らせることを意味します。便利さと引き換えに、リスクの管理も利用者に委ねられるのです。検閲なきモデルが照らし出すのは、モデルのCapabilityの限界ではなく、利用者自身がその能力とどう向き合うかという問いなのです。
用語集
abliteration:再学習なしで、モデルの重みのうち拒否に関わる方向を弱めることでセーフティフィルタの挙動を取り除く手法。
アンセンサードモデル:セーフティフィルタ(検閲・拒否応答)が除去されたモデル。
拒否方向:LLM内部で、有害と判断される入力に対する拒否反応を引き起こす特定の特徴方向。
Heretic:abliteratedモデルを自作するために用いられるツール。
アライメント:モデルを有害な出力から避けさせるよう組み込まれた調整であり、開発者側の価値判断の産物。
出典
※本記事はAGI社長の私的研鑽ノートです。モデルの安全性・利用規約は各自で確認してください。