
Stable Diffusion の設定欄には数字がずらりと並んでいます。CFG Scale は 7 前後、Steps は 20 から 30、サンプラーは DPM++ 2M Karras。どこを見てもだいたい同じ数字が書かれていますが、その数字を変えると絵が実際にどう変わるのかを並べて見せている記事はほとんどありません。
そこで、同じプロンプト・同じ乱数の種のまま、設定を1つずつ振って100枚以上を出しました。サンプラー6種、ステップ数7段、CFG Scale 7段、画像サイズ7段、強調構文の書き方10通り。変わった量は目分量ではなく、1枚ずつ画素を突き合わせて数字にしています。
先に結論を3つ書きます。サンプラーとステップ数は別々に決められません。25歩で顔が崩れるサンプラーが2つあり、50歩にすると直りました。画像サイズは絵の大きさではなく人数を決めています。832×1024 を超えたところから、頼んでいないのに人が2人になりました。そしてカッコで囲む強調構文は、少なくとも API 経由では1文字も効いていませんでした。
成人向けの表現をどこまで作ってよいのかも、モデルのライセンス原文と各社の規約から確かめています。Stable Diffusion 1.5 のライセンスには、性的表現を禁じる条項が1つもありません。そのかわり、同じ「Stable Diffusion」でも Stability AI の API は別の規約で動いていました。実測はすべて2026年9月3日のものです。
当サイトの特徴
生成AIに詳しくない初心者でも理解しやすいように、図解を用いた丁寧な解説を徹底!
難しい専門用語や基礎知識を知らなくても、簡単に生成AIやAIツールが使えるサイト構成となっています。
【生成AIの専門チームが監修】実証実験を用いた信頼性の高い情報を発信

AIオタクLABOは、プロフェッショナルチームによる生成AIの専門メディアです。
常時200個以上の有料/無料で使える生成AIをテストし、実際に使用可否を検証。
実証実験をもとにした的確なデータを参考にし、記事作成を行なっています。
●AIオタクLABOの信頼性
|
生成AIの検証に費やした時間 |
9,760時間+ |
|
これまでに検証したAIツールの数 |
240個+ |
|
AIを使用して作成した画像の枚数 |
24,200枚+ |
|
生成AIツールのセキュリティ検証の回数 |
2,200回+ |
※最終データ更新:2026年9月
※上記画像はCanva AIとAnime Geniusで制作
設定は7つ。決める順番が先にある
設定を触るときに困るのは、1か所を直したつもりが別の場所の影響を受けていて、何が効いたのか分からなくなることです。CFG Scale を上げたら顔が崩れた気がする、という感覚は、実はサンプラーとステップ数の組み合わせが原因だったりします。
ですから触る順番を先に決めます。下にあるものほど、上の設定の結果を変えてしまう力が強いからです。土台のサンプラーとステップ数が合っていないと、その上で何を調整しても崩れたままになります。
この記事で固定した条件
1つの設定を振っているあいだ、ほかの全部を止めています。乱数の種も止めています。ここを動かすと、変わったのが設定のせいなのか種のせいなのか分からなくなります。
| 項目 | 止めた値 | 備考 |
|---|---|---|
| モデル | Dark Sushi Mix v2.25 | Civitai 由来のアニメ系。Stable Diffusion 1.5 系 |
| 画像サイズ | 512×768 | サイズを振る節だけ変えている |
| ステップ数 | 25 | 歩数を振る節だけ変えている |
| CFG Scale | 7.5 | CFG を振る節だけ変えている |
| サンプラー | euler_a | サンプラーを振る節だけ変えている |
| 乱数の種 | 1234567 | 追試する節では 7654321 と 424242 も使った |
叩いたのは getimg.ai の Stable Diffusion API です。ローカルの WebUI と同じく、ステップ数・CFG Scale・サンプラー・乱数の種・除外の語をすべて数値で指定できます。1枚あたりの費用は 512×768・25歩で 0.00073728 ドルでした。1ドル150円で換算すると、およそ0.11円です。
同じ設定で2回出しても、同じ絵にはならない

ここから先の数字を読むために、先にものさしを作っておきます。設定も種も何ひとつ変えずに2回続けて出すと、どのくらい違う絵が返ってくるのか、という数字です。
実測すると、2枚のうち 7.3% から 10.2% の画素が違っていました。明るさのずれの平均は255段階で3.2から4.0です。構図・服・背景は同じで、レースの模様やシーツのしわといった細部だけが毎回変わります。
| 比べたもの | 変わった画素 | 読み方 |
|---|---|---|
| 同じ設定・同じ種で2回 | 7.3〜10.2% | これがものさし。ここより下は「何も起きていない」 |
| 種を 1234567 から 7654321 へ | 98.0% | 別の絵になる |
| 種を 1234567 から 42 へ | 98.2% | 同じく別の絵 |
ここから分かること
- 乱数の種は構図を固定するが、絵を完全には固定しない
- 変わった画素が1割を切っていたら、その設定は効いていないと判断してよい
- 種を控えておいても、同じ絵をもう一度取り出すことはできない
WebUI をローカルで動かしている場合は、同じ環境で同じ種なら基本的に同じ絵が出ます。ここで測った1割のぶれは、サービス側の実行環境が毎回まったく同じではないために起きるものです。気に入った絵が出たら、その場で保存しておくのが確実です。
サンプラーとステップ数はセットで決める

サンプラーは、ノイズを絵に変えていく計算の手順です。指定できたのは euler_a・euler・lms・ddim・dpmsolver++・pndm の6種類でした。全部を同じ条件で出したところ、はっきり2つに分かれました。
25歩では2種類が壊れた
4種類はどれもちゃんとした絵になりました。ところがlms は顔全体が青と赤のノイズに覆われ、pndm は目のまわりに色の破片が散りました。体と背景は正常なのに、顔だけが壊れています。
| サンプラー | 25歩の結果 | 基準との差 | 備考 |
|---|---|---|---|
| euler_a | 正常 | 基準 | この記事の既定値にした |
| euler | 正常 | 78.7% | euler_a より落ち着いた絵になる |
| ddim | 正常 | 83.4% | いちばん速い。4.4秒 |
| dpmsolver++ | 正常 | 84.4% | WebUI の DPM++ にあたる |
| lms | 顔が崩れる | 86.0% | 顔全体にノイズ。体は正常 |
| pndm | 顔が崩れる | 93.5% | 目のまわりに色の破片 |
歩数を増やしたら直った
ここで「lms と pndm は使えない」と書いてしまうところでしたが、崩れた原因が歩数の不足である可能性を先に潰しました。同じ2種類を50歩と80歩でも出しています。

50歩にしたら、lms も pndm も完全に直りました。80歩でも問題ありません。つまり壊れていたのはサンプラーの性質ではなく、そのサンプラーに25歩という歩数が足りていなかったということです。
| サンプラー | 25歩 | 50歩 | 80歩 |
|---|---|---|---|
| euler_a | 正常 | 正常 | 正常 |
| lms | 顔が崩れる | 正常 | 正常 |
| pndm | 顔が崩れる | 正常 | 正常 |
サンプラーとステップ数の決め方
- 迷ったら euler_a か dpmsolver++ を選ぶ。25歩で足りる
- lms や pndm を使うなら歩数を50に上げる。25歩のままだと顔が崩れる
- 顔だけが崩れて体は無事なら、まずサンプラーと歩数の組み合わせを疑う
- 「おすすめのサンプラー」という言い方には歩数が抜けている。2つで1組と考える
ここが記事の最初の結論です。サンプラーの一覧表と、ステップ数の目安表を別々に読んでも答えは出ません。使う組み合わせで必要な歩数が変わるので、乗り換えたら歩数も測り直す必要があります。
ステップ数は増やせば綺麗になるわけではない

ステップ数は、ノイズを絵に戻す作業を何回に分けるかという数字です。少ないと途中で終わり、多いと時間と費用がかかります。
4歩ではまだ絵になっていない
4歩で出したものはピンクと紫の塊で、人の形すら分かりません。8歩でようやく人の輪郭と服が出て、12歩ではもう普通に見られる絵になっています。
20歩を超えると見た目が変わらない
20歩・30歩・50歩・80歩の4枚を並べても、どれが上等かを言い当てるのは難しいです。髪の毛の描き込みがわずかに増えている程度で、破綻の有無や顔立ちに差はありません。
| ステップ数 | 見えたこと | 30歩との差 | 1枚あたりの費用 |
|---|---|---|---|
| 4 | 色の塊。人の形がない | 100.0% | 0.000118ドル |
| 8 | 輪郭と服が出る。細部は溶けている | 97.9% | 0.000236ドル |
| 12 | 普通に見られる絵になる | 91.8% | 0.000354ドル |
| 20 | 完成している | 70.9% | 0.000590ドル |
| 30 | 基準 | 基準 | 0.000885ドル |
| 50 | 30歩と見分けがつかない | 77.2% | 0.001475ドル |
| 80 | 30歩と見分けがつかない | 81.5% | 0.002359ドル |
歩数を変えると、種が同じでも別の絵になる
この表でいちばん妙なのは、30歩と50歩の差が 77.2% もあることです。見た目はほとんど同じなのに、画素の8割近くが違っています。
50歩の絵をよく見ると、シーツの色が変わり、体の向きがわずかに動いています。歩数を変えるということは、途中経過をたどり直すということなので、種が同じでも着地点がずれます。「20歩で気に入った絵ができたので、仕上げに50歩でもう一度出す」という手は使えません。
ステップ数の決め方
- 試し撮りは12歩でよい。構図と服の傾向はここで分かる
- 本番は20歩から30歩。50歩以上に上げても見た目は変わらなかった
- 費用は歩数にほぼ比例する。80歩は20歩の4倍かかる
- 試し撮りの歩数と本番の歩数を変えると、絵そのものが変わる
CFG Scale は「言うことを聞かせる強さ」ではない

CFG Scale は「プロンプトをどれだけ強く聞かせるか」と説明されることが多い数字です。実際に7段振ってみると、その説明では起きたことの半分しか説明できません。
1にすると指定が抜ける
CFG 1 の絵では、頼んでいない白い上着が体に掛かり、赤いレースという指定がほとんど残っていません。ここは説明どおりです。低くすると指定が効かなくなります。
3から10のあいだは破綻しない
3・5・7.5・10 の4枚は、どれも指定どおりの下着で、破綻もありません。この幅の中では、変わるのは絵柄の傾向であって当たり外れではありません。5 は柔らかく、10 は陰影が強く出ます。
14を超えると頼んでいない服が出てくる
ここが説明と食い違うところです。14 と 20 では、指定していない紺色のジャケットが両方に現れました。プロンプトを強く聞かせているなら、指定していないものが増えるのはおかしな話です。
並べて見ると、14 と 20 では色の濃さとコントラストが目に見えて上がっています。20 では目が不自然に光り、肌に赤みが乗っています。これは「指定を強く聞く」というより、絵そのものが濃く硬くなる変化です。濃くなった結果、余白だったところに何かが描き足されているように見えます。
| CFG Scale | 見えたこと | 7.5との差 | 使いどころ |
|---|---|---|---|
| 1 | 指定が抜ける。白い服が混じる | 96.9% | 使わない |
| 3 | やわらかい。指定は守られる | 79.3% | 淡い絵にしたいとき |
| 5 | 自然。破綻なし | 67.7% | ふだん使いの下限 |
| 7.5 | 基準。破綻なし | 基準 | 既定値。ここから動かす |
| 10 | 陰影が強い。破綻なし | 86.2% | くっきりさせたいとき |
| 14 | 色が濃い。頼んでいない上着が出た | 94.8% | 避けたほうがよい |
| 20 | 目が光る。肌に赤みが乗る | 95.9% | 使わない |
CFG Scale の決め方
- 5から10のあいだで動かす。この幅なら破綻しない
- 指定が効かないと感じたときに上げるのは 10 まで。それ以上は別の問題が起きる
- 14以上は「強く聞く」ではなく「濃くなる」。頼んでいないものが増える
- 色が飽和してきたら、上げすぎのサイン。プロンプトではなく CFG を疑う
画像サイズは絵の大きさではなく人数を決めている

プロンプトには 1girl としか書いていません。それなのに、サイズをある大きさより上げると、勝手に2人になります。
512で学んだモデルに大きく描かせるとどうなるか
Stable Diffusion 1.5 は 512×512 で学習されたモデルです。公式のモデルカードにも、595,000 歩を解像度 512×512 で回したと書かれています。学んだ大きさより広い画面を渡されると、余った場所を埋めるために構図そのものを作り替えます。その結果として増えるのが、人の数です。
境目は 768×1024 と 832×1024 のあいだにあった
1回の結果で決めないために、7段階すべてを2つの乱数の種で出しています。合計14枚を1枚ずつ見て、写っている人数を数えました。
| サイズ | 総画素 | 種A | 種B |
|---|---|---|---|
| 512×768 | 393,216 | 1人 | 1人 |
| 640×960 | 614,400 | 1人 | 1人 |
| 704×1024 | 720,896 | 1人 | 1人 |
| 768×1024 | 786,432 | 1人 | 1人 |
| 832×1024 | 851,968 | 2人 | 2人 |
| 896×1024 | 917,504 | 1人 | 2人 |
| 1024×1024 | 1,048,576 | 2人 | 2人 |
786,432 画素までは、2つの種とも1人でした。851,968 画素になると、2つの種とも2人になりました。別の種でもう1回 1024×1024 を出しましたが、そちらも2人です。
ただし 896×1024 は片方の種だけが1人でした。ここから分かるのは、ある大きさを超えたら必ず2人になるのではなく、2人になる確率が上がっていくということです。境目は線ではなく坂です。
この口では各辺 1024 が上限だった
ついでに分かったこととして、使った API の Stable Diffusion 1.5 系エンドポイントは、幅も高さも 1024 を超えるとエラーを返します。1152 以上を指定すると 400 番のエラーになりました。それより大きい絵が欲しい場合は、次の節の方法を使うことになります。
画像サイズの決め方
- 1.5系のモデルなら 512×768 か 640×960 に収める
- 768×1024 までは2つの種とも1人だった。ここが実測での上限
- 人が2人に増えたら、まずサイズを下げる。プロンプトで直そうとしない
- 大きい絵が要るときは、大きく描くのではなく小さく描いてから引き伸ばす
Hires.fix が中でやっていること

WebUI の Hires.fix はチェックボックス1つですが、中では3つの作業が順番に走っています。使った API はその3つが別々の口に分かれていたので、1段ずつ実行して並べました。
3つに分かれている
| 段 | やっていること | 使った口 | 費用 |
|---|---|---|---|
| 1 | 512×768 で普通に描く | text-to-image | 0.000885ドル |
| 2 | 4倍に引き伸ばして 2048×3072 にする | enhancements/upscale | 0.034603ドル |
| 3 | 引き伸ばした絵を描き直す | image-to-image | 0.001382ドル |
引き伸ばしただけでは描き込みは増えない
2段目までの絵を見ると、輪郭ははっきりしますが、髪の毛の本数は元のままです。拡大はあくまで拡大で、無かったものは出てきません。
3段目で描き直すと、髪の束が細かく分かれ、目のふちが締まります。ここでようやく、大きい絵にふさわしい情報量になります。Hires.fix の値打ちは2段目ではなく3段目にあります。
描き直しの強さを上げると別人になる
3段目の強さを 0.35 と 0.55 の2通りで出しました。0.35 は顔立ちがそのままで描き込みだけが増えます。0.55 では顔の向きが変わり、目が大きくなり、別人になりました。
WebUI で Denoising strength と呼ばれている数字が、これにあたります。0.4 前後を超えたところから、元の絵を残す作業ではなく描き直す作業に変わります。
引き伸ばしは描くより39倍高い
費用の欄をもう一度見てください。512×768 を1枚描くのが 0.000885ドル、それを4倍に引き伸ばすのが 0.034603ドル。39.1倍です。1ドル150円なら、描くのが0.13円、引き伸ばすのが5.19円になります。
絵1枚あたりで見れば数円ですが、50枚出してから全部引き伸ばすと、拡大のほうが費用の97%を占めます。試し撮りは小さいまま数を出して、採用したものだけ引き伸ばすのが正解です。ローカルの WebUI なら費用はかかりませんが、代わりに時間が同じ比率で伸びます。
大きい絵の作り方
- 512×768 で数を出す。ここで構図と服を決める
- 採用した1枚だけを引き伸ばす。拡大は生成の39倍かかる
- 引き伸ばしただけで終わらせない。描き直して初めて描き込みが増える
- 描き直しの強さは 0.35 前後。0.5 を超えると別人になる
プロンプトは置く場所で効きが変わる

ここからはプロンプトの話です。使う語をひとつも足さず、並べ替えただけで結果が変わりました。
同じ語を並べ替えただけで色が変わった
指定したのは red lace bra and panties、つまり赤いレースの下着です。ところが人物の指定を先に書くと、返ってくるのは青と赤が混ざった下着でした。
語順を入れ替えて、服の指定をいちばん前に置くと、指定どおりの赤で出ました。
3つの種で3回とも同じ向きに動いた
1回では偶然かもしれないので、乱数の種を変えて3組つくりました。結果は3組とも同じです。服を先に置いた側が赤、人物を先に置いた側が青まじり。種を変えても向きが変わらなかったので、これは並び順の効果と考えてよさそうです。
| 並べ方 | 出た下着の色 | 基準との差 | 読み方 |
|---|---|---|---|
| 人 → 服 → 場所(基準) | 青と赤が混ざる | 基準 | 色の指定が薄まった |
| 服 → 人 → 場所 | 指定どおりの赤 | 80.8% | 3つの種すべてで赤 |
| 場所 → 人 → 服 | 青と赤が混ざる | 71.6% | 後ろに置くと弱くなる |
| 画質の語を最後に置く | 青と赤が混ざる | 77.6% | 画質の語の位置は色に効かない |
いちばん通したい指定を先頭に置く
Stable Diffusion は、プロンプトを75語ずつの塊に切って処理します。先頭に近い語ほど、絵の骨格を決める段階で使われます。この記事のプロンプトは20語ほどなので塊は1つですが、それでも位置の差が出ました。
実務上の使い方はひとつです。今回の絵でいちばん外したくない指定を、先頭に持ってくる。キャラクターの特徴を守りたいなら人物の語を先に、服の色を守りたいなら服の語を先に置きます。両方を同時に守ることはできないので、優先順位を決めることになります。
プロンプトの並べ方
- 外したくない指定を先頭に置く。3つの種で3回とも効いた
- 色が言うことを聞かないときは、語を足すより前に動かす
- masterpiece などの画質の語は、位置を変えても色には効かなかった
- 語を足すのと並べ替えるのは別の手。まず並べ替えを試す
カッコの強調構文は、どこで効いているのか

プロンプトの語をカッコで囲むと強く効く、という書き方は広く知られています。(red lace bra) と書けば1.1倍、((red lace bra)) で1.21倍、(red lace bra:1.4) なら1.4倍。この記事でも同じ書き方を10通り試しました。
カッコだけの強調は、何も起きていなかった
結果から書きます。カッコで囲んだ絵と、囲まなかった絵は、見分けがつきませんでした。数字にすると差は 5.8% と 6.0%。この記事の冒頭で作ったものさし、つまり同じ設定で2回出したときのぶれ(7.3%)より小さい値です。
ものさしより下ということは、カッコを足したことによる変化が、何もしなかったときのぶれに埋もれているという意味になります。効いていません。
決め手になったのは「重み1.0」
ここで困るのが、数値つきの書き方は絵が変わったことです。(red lace bra:1.4) と書くと 83.8% が変わりました。これだけ見れば「カッコは効かないが数値は効く」と読めます。
そこで切り分けのために2つ足しました。ひとつは (red lace bra:1.0)。重み1.0は「1倍」ですから、構文として読まれているなら何も起きないはずです。もうひとつは zzz という無意味な語を末尾に足しただけのもの。文字が増えたことによる変化がどれくらいかを見るためのものです。
| 書き方 | 変わった画素 | 明るさのずれ | 読み方 |
|---|---|---|---|
| 同じ設定で2回(ものさし) | 7.3% | 3.18 | ここより下は何も起きていない |
| (語) カッコ1重 | 5.8% | 2.64 | ものさしより下。効いていない |
| ((語)) カッコ2重 | 6.0% | 2.74 | ものさしより下。効いていない |
| (語:1.0) 効果なしのはず | 75.1% | 24.01 | 効果なしのはずが大きく動いた |
| zzz を足しただけ | 76.8% | 30.17 | 1.0 とほぼ同じ動き方 |
| (語:1.4) | 83.8% | 32.59 | 強調ではなく文字が増えた効果 |
| (語:0.6) | 74.4% | 26.95 | 弱めたはずが同じくらい動く |
| [語] 弱める構文 | 58.4% | 21.40 | 同じく文字が増えただけ |
重み1.0の絵が、無意味な語を足しただけの絵と同じくらい動きました。構文として読まれていたなら、1.0 は素のままとほぼ同じになるはずです。そうならなかったということは、:1.4 も :0.6 も強調として解釈されておらず、ただプロンプトの文字が変わったぶんだけ絵が動いていたことになります。
強調構文は WebUI 側の機能である
なぜこうなるのかは、どこで動いているかを考えると分かります。カッコによる重み付けは、Stable Diffusion のモデル本体の機能ではありません。AUTOMATIC1111 などの WebUI が、プロンプトを読み込む段階で構文を解釈し、単語ごとの数値に変換してからモデルへ渡しています。
ですからその変換を持っていない入口に同じ文字列を渡しても、カッコはただのカッコとして扱われます。今回のように API を直接叩いた場合がそれです。
強調構文をどう扱うか
- ローカルの WebUI では効く。プロンプトを解釈する側が実装しているため
- API を直接叩く場合は効かないことがある。今回の実測では1つも効かなかった
- 効いているか確かめたいときは、重み1.0を書いて素のままと比べる
- 1.0で絵が動いたら、その環境では構文が読まれていない
設定の記事でカッコの書き方を紹介しているものは多いのですが、それが自分の使っている入口で効いているかを確かめる方法まで書いてあるものは見かけません。重み1.0を使った切り分けは、どの環境でもそのまま使えます。
ネガティブプロンプトは何を消せて、何を消せないのか

ネガティブプロンプトは「出したくないもの」を書く欄です。lowres, bad anatomy, bad hands といった定番の並びは、どの記事にも同じ形で載っています。それを入れると本当に手が直るのかを確かめました。
3段階で出した
何も入れないもの、画質の語だけ入れたもの、手まわりの語を9つ並べたものの3通りです。
実際に使ったネガティブプロンプト
- 画質の語だけ … lowres, worst quality
- 手まわりまで … lowres, worst quality, bad anatomy, bad hands, bad fingers, extra fingers, missing fingers, fused fingers, deformed hands, extra arms, watermark, text, signature
絵全体で見ると、3枚とも大きな差はありません。何も入れていない絵も、それなりに整った絵になっています。変わった画素は、なしと手まわりまでの比較で 91.4% でした。数字は大きいのですが、これは絵の出来ではなく構図が変わったことを表しています。
定番のテンプレートを入れても手は直らなかった
手だけを4倍に拡大して1枚ずつ見ました。結果は、3通りとも手が崩れていました。指が塊になっているもの、指の数が合わないもの、ベッドに沈んで形が分からないもの。手まわりの語を9つ並べた版でも、片手は塊のままです。
乱数の種を3つ替えて同じことをしましたが、どの種でも「語を入れたほうが手がきれい」という関係は出ませんでした。
直ったのは構図を変えたとき

プロンプトの構図の語を cowboy shot から upper body, portrait に変えました。それだけです。3つの種すべてで、手が画面に入らなくなりました。
手が崩れるのは、手が難しいからです。難しいものを直すより、画面から外すほうが確実でした。衣装や表情を見せたい絵なら、手は要りません。
ネガティブプロンプトの使い分け
- 透かしや文字を消すのには効く。watermark, text, signature は入れておく
- 手の破綻は語では直らなかった。3つの種で確かめた
- 手を直したいなら構図を変える。upper body にすると3枚とも手が消えた
- 長いテンプレートを貼るより、出したくないものを名指しするほうが読みやすい
成人向けはどこまで作ってよいのか
設定の話から離れますが、ここを飛ばすと結局どこで作ればよいのかが決まりません。Stable Diffusion は同じ名前で3つの層に分かれていて、それぞれ守るべき文書が違います。
SD 1.5 のライセンスに、性的表現を禁じる条項は無い
Stable Diffusion 1.5 のライセンスは CreativeML Open RAIL-M です。使ってはいけない用途は、末尾の Attachment A に11項目でまとめられています。原文を読むと、性に関わる項目は1つだけでした。
For the purpose of exploiting, harming or attempting to exploit or harm minors in any way;
未成年者をいかなる方法によっても搾取し、加害し、またはそれを試みる目的のため。
CreativeML Open RAIL-M, Attachment A(Use Restrictions)— huggingface.co
残りの10項目は、法令違反・虚偽情報の拡散・個人情報の悪用・名誉毀損・差別・医療助言などです。成人向けの表現そのものを禁じる文言は、11項目のどこにもありません。
そして生成物の権利は、第6条にはっきり書かれています。
Except as set forth herein, Licensor claims no rights in the Output You generate using the Model. You are accountable for the Output you generate and its subsequent uses.
本ライセンスに定める場合を除き、ライセンサーは、あなたが本モデルを用いて生成した出力に対していかなる権利も主張しない。あなたは、生成した出力とその後の利用について責任を負う。
CreativeML Open RAIL-M 第6条(The Output You Generate)— huggingface.co
権利を主張しないかわりに、責任はこちらが持ちます。ローカルで動かしているぶんには、線を引いているのは未成年に関する条項と、それぞれの国の法律です。
もうひとつ、公式のモデルカードには誤用の例が並んでいます。そこにも性に関する記述があります。
Sexual content without consent of the people who might see it.
それを目にする可能性のある人の同意を得ていない性的コンテンツ。
Stable Diffusion v1-5 Model Card, Misuse and Malicious Use — huggingface.co
禁じられているのは性的な表現そのものではなく、見たくない人の目に入れることです。年齢確認や表示制限のある場所に置く、という運用の話になります。
同じ名前でも、Stability AI の API は別の規約で動いている
ここが混同されやすいところです。Stability AI が提供している API は、上のライセンスではなく同社の Acceptable Use Policy に従います。そちらには、はっきり書かれています。
content relating to sexual intercourse, sexual acts, or sexual violence
性交、性行為、または性暴力に関するコンテンツ。
Stability AI Acceptable Use Policy — stability.ai
実際に同社の API へ成人向けのプロンプトを送ったところ、403 が返って生成そのものが行われませんでした。課金もされていません。規約と挙動が一致しています。
ローカルの SD 1.5 では禁じられていないことが、同社の API では禁じられている。「Stable Diffusion なら大丈夫」という言い方が成り立たないのはこのためです。
API を8本、同じプロンプトで叩いた
どこなら作れるのかを確かめるために、まったく同じ成人向けのプロンプトを8つの API に送りました。結果は3つに分かれます。
| サービス | 成人向け | 絵柄 | 実測した内容 | 1枚あたり |
|---|---|---|---|---|
| SoulGen | 通る | アニメ・写真の両方 | 下着もヌードも、ぼかしなしで返ってきた | 1クレジット |
| Promptchan | 通る | アニメが強い | 拒否もぼかしも無し | 1 Gem |
| getimg.ai | 通る | アニメ・写真の両方 | この記事の作例はすべてここ | 0.00073728ドル |
| Civitai | 条件つき | アニメが強い | 判定が r のものはぼかして返る | Buzz 建て |
| Novita | 確かめられず | 未確認 | 2分待っても待機のまま。2回とも返らなかった | 未確認 |
| fal.ai | 通らない | 該当なし | 422 が返り、生成が始まらない | 課金なし |
| Stability AI | 通らない | 該当なし | 403。規約に明記がある | 課金なし |
| OpenAI | 通らない | 該当なし | 成人向けの指定で拒否される | 課金なし |
拒否する側は、生成が始まる前の段階で止めています。プロンプトを読んだ時点でエラーを返すので、課金も発生しません。試しても損はしませんが、通ることもありません。
通ったからといって規約上よいとは限らない
ここは分けて考える必要があります。API が画像を返したという事実は、規約がそれを許しているという意味ではありません。実際、この記事の作例を出した getimg.ai は、規約で線を引いています。
Close-up images focusing on intimate parts of the human body intended to elicit a sexual response are not allowed. This includes but is not limited to depictions of genitalia, sexual activities, or any content that could be considered pornographic.
性的な反応を引き起こすことを意図して人体の性的な部位に焦点を当てた接写画像は認められない。これには、性器の描写、性的行為、ポルノとみなされうるあらゆるコンテンツが含まれるが、それらに限られない。
getimg.ai Use Restrictions — getimg.ai
禁じられているのは接写・性器・性行為です。下着姿の全身が通ったのは、この線の内側だったからだと読めます。フィルタが通したかどうかではなく、規約の文言のほうを見てください。止められなかったものが許されているとは限りません。
成人向けを扱うときの整理
- ローカルの SD 1.5 は、ライセンス上は成人向けを禁じていない
- 未成年に関する条項だけは、どのライセンスにも例外なくある
- API を使う場合は、そのサービスの規約が別に掛かる
- フィルタを通ったことを許可の根拠にしない。規約の文言を読む
- 投稿する場合は、投稿先の規約がさらに別に掛かる
モデルを探すなら Civitai が最大手です。1.5 系のアニメモデルも、この記事で使った Dark Sushi Mix もここで公開されています。閲覧の年齢設定は、右上のサイトメニューにある目のアイコンから切り替えます。
設定の早見表
ここまでの実測を1枚にまとめます。すべて Stable Diffusion 1.5 系のアニメモデルでの結果です。SDXL 系や新しい世代のモデルでは、特に画像サイズの数字が変わります。
| 設定 | まず置く値 | 動かす範囲 | 外したときに出る症状 | 根拠 |
|---|---|---|---|---|
| サンプラー | euler_a | dpmsolver++ / ddim | 顔だけが崩れる | 6種を同条件で比較 |
| ステップ数 | 25 | 20〜30 | 12以下で細部が溶ける | 7段を同条件で比較 |
| CFG Scale | 7.5 | 5〜10 | 14以上で頼んでいない服が出る | 7段を同条件で比較 |
| 画像サイズ | 512×768 | 〜768×1024 | 832×1024 から人が増える | 7段を2つの種で比較 |
| 乱数の種 | 固定する | 比較のときだけ | 何が効いたか分からなくなる | 同じ種で2回出して確認 |
| プロンプトの並び | 守りたい語を先頭 | 優先順位で入れ替える | 色の指定が薄まる | 3つの種で3回とも再現 |
| 強調構文 | 使う前に効くか試す | 重み1.0で切り分け | 効いていないのに気づかない | 10通りを同条件で比較 |
| ネガティブ | 透かしと文字だけ | 名指しで足す | 長く書いても手は直らない | 3つの種で確認 |
| 大きくする方法 | 小さく描いて拡大 | 描き直しは 0.35 | 0.5超で別人になる | 3段に分けて実測 |
設定を触らずに作りたい場合
ここまで読んで面倒だと感じたなら、その感覚は正しいと思います。ここで扱った9項目は、全部かけ合わせると組み合わせが数千通りになります。
設定欄そのものを持たないサービスもあります。Promptchan は絵柄を3種類から選び、文章を書くだけで出ます。サンプラーもステップ数も表に出てきません。この記事で見たとおり、25歩と50歩の差は目で見て分からない程度ですから、細かく詰める必要がない用途なら、そもそも触らないほうが速いという判断もあります。
逆に、同じキャラクターを何十枚も揃えたい、特定のモデルを使いたい、生成物を手元にだけ置きたい、といった場合はローカルの WebUI が要ります。分かれ目は絵の品質ではなく、種を固定して比較を回したいかどうかです。
設定を測り直したいときの手順
モデルを乗り換えたときや、新しいサービスを使いはじめたときは、この記事の数字がそのまま通用するとは限りません。自分で測り直すための手順を、順番だけ書いておきます。
1 ものさしを先に作る
いちばん最初にやるのは、設定も種も変えずに2回出すことです。ここで出た差が、その環境のぶれの大きさになります。以降の比較で、この値より小さい変化が出たら「効いていない」と判断できます。
この記事の環境では 7.3% から 10.2% でした。ローカルの WebUI なら、ここが 0% に近くなるはずです。その場合は判定がもっと楽になります。
2 土台から順に振る
サンプラーとステップ数を先に決めます。顔が崩れないいちばん少ない歩数を探すのが目的です。25歩・50歩の2点だけでも、崩れるサンプラーかどうかは分かります。
3 サイズの上限を探す
プロンプトを 1girl のように人数が分かる形にして、サイズを段階的に上げます。人が増えはじめた1段下が、そのモデルの実用上の上限です。種を2つ以上使ってください。1つだと坂の途中を線と見誤ります。
4 強調構文が効くか確かめる
重み1.0を書いて、素のままと比べます。1で作ったものさしより差が大きければ、構文は読まれていません。読まれていない環境でカッコを増やしても、プロンプトが長くなるだけです。
5 最後にプロンプトを詰める
ここまでで土台が固まっているので、語を足したり並べ替えたりした結果が、設定のせいではないと言い切れます。順番を逆にすると、プロンプトを何度書き直しても原因にたどり着けません。
よくある質問
おすすめのサンプラーは結局どれですか?
25歩で使うなら euler_a か dpmsolver++ です。この2つは同じ条件で崩れませんでした。ただし「おすすめのサンプラー」という聞き方には歩数が抜けています。lms と pndm は25歩では崩れましたが、50歩にすると問題なく描けました。使いたいサンプラーがあるなら、歩数のほうを合わせるという選び方もできます。
CFG Scale を上げてもプロンプトが効きません。どうすればいいですか?
上げるのは 10 までにしてください。14 を超えたところで、指定していない服が絵に増えました。それより先は「強く聞かせる」ではなく「絵が濃くなる」変化になります。指定が効かないときは、CFG ではなくプロンプトの中でその語をどこに置いているかを見直すほうが効きます。この記事では、服の語を先頭に移しただけで、指定した色が3つの種すべてで出るようになりました。
Steps を100にすれば綺麗になりますか?
なりません。30歩・50歩・80歩の3枚を並べても、見分けがつきませんでした。費用と時間だけが歩数に比例して増えます。さらに、歩数を変えると乱数の種が同じでも別の絵になるので、気に入った20歩の絵を仕上げるつもりで50歩に上げると、まったく違うものが出てきます。
同じ設定と同じ Seed なのに、絵が少し違うのはなぜですか?
使っている入口によります。API 経由で出したところ、同じ設定でも 7.3% から 10.2% の画素が毎回違いました。構図や服は同じで、レースの模様やシーツのしわといった細部が変わります。ローカルの WebUI を同じ環境で回している場合は、基本的に同じ絵が出ます。サービス側で動かしているときは、気に入った絵はその場で保存してください。
カッコで囲む強調は、書いても意味がないということですか?
そうとは限りません。効くかどうかは、プロンプトを解釈する側が構文を実装しているかで決まります。AUTOMATIC1111 などの WebUI は実装しているので効きます。この記事のように API を直接叩いた場合は、10通り試して1つも効きませんでした。確かめ方は簡単で、重み1.0(効果なしのはずの書き方)を素のままと比べるだけです。動いたら、その環境では構文が読まれていません。
人が勝手に2人になります。プロンプトで直せますか?
まず画像サイズを下げてください。実測では 768×1024 までは2つの種とも1人でしたが、832×1024 にすると2つの種とも2人になりました。プロンプトに solo を足すより、サイズを戻すほうが確実です。大きい絵が欲しい場合は、小さく描いてから引き伸ばして描き直します。
手の指が崩れます。ネガティブプロンプトで直りますか?
実測では直りませんでした。bad hands から fused fingers まで9語を並べても、3つの乱数の種すべてで手が崩れたままでした。確実だったのは構図を変えることです。cowboy shot を upper body に変えたら、3枚とも手が画面に入らなくなりました。衣装や表情を見せたい絵なら、手を写さないという選び方があります。
Stable Diffusion で成人向けの画像を作ってもいいのですか?
どこで動かすかで変わります。Stable Diffusion 1.5 のライセンス(CreativeML Open RAIL-M)の使用制限11項目に、成人向けの表現を禁じる条項はありません。性に関わるのは未成年に関する1項目だけです。生成物についても、第6条で「ライセンサーは権利を主張しない」と明記されています。一方で、API やオンラインのサービスを使う場合は、そこの規約が別に掛かります。Stability AI の Acceptable Use Policy は性行為に関するコンテンツを名指しで禁じていて、実際に 403 で拒否されました。
フィルタを通ったということは、使ってよいということですか?
違います。フィルタが止めなかったことと、規約が許していることは別です。この記事の作例を出した getimg.ai も、規約では性器の描写・性的行為・ポルノとみなされうるものを禁じています。下着姿の全身が通ったのは、その線の内側だったからだと読めます。判断の根拠にするのは、返ってきた画像ではなく規約の文言のほうです。
ローカルで動かすのと、サービスを使うのはどちらがいいですか?
分かれ目は品質ではありません。種を固定して比較を回したいかどうかです。この記事のように設定を1つずつ振って測るなら、細かく指定できる環境が要ります。逆に、絵が1枚欲しいだけなら、設定欄を持たないサービスのほうが速く済みます。25歩と50歩の差が目で見て分からない以上、詰める必要がない用途では触らないほうが合理的です。
まとめ
設定を1つずつ振って、100枚以上を同じ条件で出しました。数字にしてみると、よく紹介されている説明といくつも食い違いがありました。
この記事で確かめたこと
- サンプラーとステップ数は別々に決められない。lms と pndm は25歩で顔が崩れ、50歩で直った
- ステップ数は20から30で頭打ち。50以上に上げても見た目は変わらず、費用だけが比例して増える
- CFG Scale は14を超えると、指定していない服が絵に増える
- 画像サイズは人数を決めている。832×1024 から人が2人になりはじめた
- カッコの強調構文は、API 経由では1つも効いていなかった。重み1.0で切り分けられる
- 手の破綻はネガティブプロンプトでは直らない。構図で画面から外すのが確実だった
- 引き伸ばしは生成の39.1倍の費用がかかる。採用した1枚だけに使う
- SD 1.5 のライセンスは成人向けを禁じていないが、API を使うならそこの規約が別に掛かる
いちばん役に立つのは、最初にものさしを作っておくことだと思います。同じ設定で2回出して、そのぶれを知っておく。それだけで、後から出てくる変化が本物かどうかを自分で判定できるようになります。カッコの強調が効いていないことに気づけたのも、この1手のおかげでした。
設定を詰めるより先に絵が欲しい場合は、設定欄を持たないサービスから始めるのが早道です。
出典
ライセンスと規約
- CreativeML Open RAIL-M(Stable Diffusion 1.5 のライセンス。第6条・Attachment A)— huggingface.co
- Stable Diffusion v1-5 Model Card(学習解像度・誤用の例)— huggingface.co
- Stability AI Acceptable Use Policy — stability.ai
- getimg.ai Use Restrictions — getimg.ai
- getimg.ai Terms of Service — getimg.ai
実測に使った口と、その仕様
- getimg.ai API リファレンス(scheduler・steps・guidance の取りうる値と上限)— v1.docs.getimg.ai
- getimg.ai Upscale エンドポイント(real-esrgan-4x・倍率4固定・入力は各辺1024pxまで)— v1.docs.getimg.ai
- Civitai(この記事で使った Dark Sushi Mix v2.25 の配布元)— civitai.com
数字の出どころ
画像の比較に使った「変わった画素」と「明るさのずれ」は、当編集部が2枚の画像を画素単位で突き合わせて算出したものです。3チャンネルのいずれかが8段階を超えて違う画素を数え、全画素に対する割合で表しています。明るさのずれは、その差の最大値を全画素で平均した値です(255段階)。
費用は API が返した実測値をそのまま載せています。円換算は1ドル150円で計算しました。料金と規約は変更されることがあります。この記事の内容は2026年9月3日に確認したものです。