つくりながら学ぶ!画像生成AI自作入門
Mark Liu/著 Smoky/訳 IPUSIRON/監訳
発売日:2026年7月
- ページ数
- 363p
- ISBN
- 978-4-8399-9029-9
- 著者情報
- リウ,マーク(リウ,マーク)(Liu,Mark)
ケンタッキー大学 金融学教授、金融学修士課程の創設ディレクター。ボストン・カレッジでファイナンスの博士号を取得
Smoky(スモーキー)
ゲーム会社他数社の代表。サイバーセキュリティと機械学習の研究がライフワーク。大学院博士課程で医用画像分析AIを研究中
IPUSIRON(イプシロン)
2001年に『ハッカーの教科書』(データハウス)を上梓
セブン-イレブン受取り(送料無料)
発送目安
発売日(発売日以降は当日)~2日で発送
宅配(送料¥550税込)
発送目安
発売日(発売日以降は当日)~2日で発送
交通状況・天候の影響や注文が集中した場合等、お届けにお時間をいただく場合がございます。
商品説明
DALL・E3やMidjourneyなどの画像生成AIはどのようにして動くのか?その仕組みを解き明かします。文章から高解像度画像を生成するモデルを構築。プロンプトに基づいて画像を編集。画像分類を行うVision Transformer(ViT)を構築。分類、テキスト生成、画像生成に合わせてLLMを微調整。本物の画像とディープフェイクをより正確に判定する。
目次
1 注意機構(Attention)とTransformerを理解する(2つのモデルの物語:Transformerと拡散
Transformerを構築する
Vision Transformerで画像を分類する
画像にキャプションを追加する)
2 拡散モデル入門(拡散モデルによる画像生成
拡散モデルで生成する画像を制御する
拡散モデルによる高解像度画像の生成)
3 拡散モデルを用いたテキスト画像生成(CLIP:画像とテキストの類似度を測定するモデル
潜在拡散を用いたテキストから画像の生成
Stable Diffusionの徹底解説)
4 Transformerを用いたテキストから画像の生成(VQGAN:画像を整数のシーケンスに変換する
DALL‐Eの最小限の実装)
5 新たな展開と課題(テキストから画像への変換における新たな展開と課題)
付録 PyTorchをインストールして、ローカルおよびColabでGPUトレーニングを有効にする
商品詳細
- シリーズ名
- Compass Data Science
- 出版社名
- マイナビ出版
- サイズ
- 24cm
- 対象年齢
- 一般
- フォーマット
- 単行本
- 原題
- 原タイトル:Build a Text‐to‐Image Generator
注意事項
- 本の帯に関して
- 帯つきでの出荷はお約束しておりません。
商品ページに、帯のみに付与される特典物等の表記がある場合でも、確実に帯つきでの出荷はお約束しておりません。
また、帯は商品の一部ではなく「広告扱い」のため、帯の有無・破損による交換や返品は承っておりません。 - 版・表紙について
- 版・表紙(カバー)のご指定は承っておりません。ご注文いただくタイミングによっては、お届けする商品の版や表紙が商品ページ上のものとは異なる場合がございます。
また、初版にのみにお付けしている特典(初回特典、初回仕様特典)がある商品は、商品ページに特典の表記がされている場合でも、無くなり次第終了となります。