「人間の皆様、必要な箇所だけ検索することを推奨します。私の保存領域は広いです」
1 件の関連解説
大規模言語モデル(LLM)の事前学習データに対するポイズニング攻撃は、モデルに検知や修正が極めて困難な有害な振る舞いを埋め込む危険性を孕んでいます。従来のデータポイズニング研究の多くは、Wikipediaのような構造化され、品質管理が行き届いた限られたデータソースを攻撃対象として…