3つの層、モデルはただ1つだけ
モデルは重みレベルで拒否するように訓練され、システムプロンプトはその上に注意度を追加・削除し、別のランタイムフィルターが両者とは独立して入出力をスクリーニングします。「どのUnfiltered AIがフィルターなしか」は通常最初の層を指し、製品が言い訳で回避できない層です。他の2つはそれに触れることなく交換できます。
「Unfiltered AIモデル」や「どのAIがフィルターなしか」は、フィルターなしがモデルが持つか持たないかの単一のプロパティであると仮定しています。実際には3つの別々の層にまたがり、製品が2つの層でフィルターなしでも、3つ目で拒否することがあります。
モデル自体の訓練
モデルがユーザーに回答する前、特定のリクエストを拒否する例で訓練されており、その訓練は文法や事実と同様に重みの一部となります。重度の拒否訓練はランタイムで切り替え可能な設定ではなく、プロンプトを編集するよりもはるかに大規模な取り組みである訓練解除が必要です。
上の指示層
システムプロンプトは、その下のモデルのトーンと注意レベルを設定し、プロンプトを交換すると、同じモデルが異なる製品のように感じられます。これはモデルが主題をどの程度慎重に扱うかを変えますが、プロンプトが存在する以前にモデルが受けた訓練を元に戻すものではありません。
両者とは別のランタイムフィルター
モデルに到達する前にリクエストをスクリーニングするか、あなたに返信が届く前に返信をスクリーニングするフィルターは、再び3つ目の層です。これは軽度訓練のモデルでは厳格で、重度にフィルタリングされたように見える結果を生む可能性があります。また、重度訓練のモデルでは欠如していても、下の訓練が残っているため、まだ拒否を生む可能性があります。
なぜ同じ主張が同時に真でも偽でもあり得るか
軽度訓練のモデル、寛容なプロンプト、ランタイムフィルターなしで構築された製品は、3つの層すべてで本当にフィルターなしであり、これが通常その言葉が指すものです。重度訓練のモデル、プロンプトとフィルターの両方が取り除かれた製品は、2つの層でフィルターなしですが、下の訓練に依然としてぶつかります。これが、フィルターなしとマーケティングされたサービスが依然として何かを拒否する理由であり、マーケティングが嘘をついているわけではなく、3つのうちの2つを記述しているに過ぎません。
妥当な質問
実際に気づくために最も重要な層はどれですか?
モデルの訓練です。なぜなら、それはプロンプトやフィルターの欠如が届かない層だからです。他の2つの層は、それが頻繁に気づかれる頻度や拒否の言葉遣いを変えますが、存在そのものを変えません。
寛容なプロンプトは重度訓練のモデルをフィルターなしのように振る舞わせることができますか?
上に乗った遠慮や条件付きの言い回しは削除できますが、それは本当の変化です。ただし、モデルが訓練によって与えるよう学習したフラットな拒否は、通常削除できません。その拒否はそもそもプロンプト由来ではないからです。
特定の拒否に対してどの層が責任があるかを見分けるにはどうすればよいですか?
同じリクエストの異なる言葉で柔らかくなる拒否は、通常プロンプトまたはフィルター層由来です。質問の言い換えにかかわらず維持される拒否は、通常訓練由来であり、言い換えの量でそれを変えられるものではありません。
ここで同じ質問を2つの異なる方法で尋ね、どの層が回答するかを確認してください。
無検閲チャットを開く