Pythonで学ぶ強化学習 入門から実践まで「改訂第2版」

久保隆宏/著

発売日:2019年9月

  • Pythonで学ぶ強化学習 入門から実践まで「改訂第2版」
  • Pythonで学ぶ強化学習 入門から実践まで「改訂第2版」
版数
改訂第2版
ページ数
297p
ISBN
978-4-06-517251-3

¥3,520 税込

16 nanacoポイント

16 セブンマイル

セブン-イレブン受取り(送料無料)

発送目安

発売日(発売日以降は当日)~2日で発送

宅配(送料¥550税込)

発送目安

発売日(発売日以降は当日)~2日で発送

交通状況・天候の影響や注文が集中した場合等、お届けにお時間をいただく場合がございます。

商品説明

Pythonプログラミングとともに、ゼロからていねいに解説。コードが公開されているから、すぐ実践できる。実用でのネックとなる強化学習の弱点と、その克服方法まで紹介。

「Pythonで強化学習が実装できる!」と好評を得た入門書の改訂版。読者からの要望・指摘を反映させた。主に、Policy GradientとA2Cの記述・実装を見直した。

・Pythonプログラミングとともに、ゼロからていねいに解説。
・コードが公開されているから、すぐ実践できる。
・実用でのネックとなる強化学習の弱点と、その克服方法まで紹介。

【おもな内容】

Day1 強化学習の位置づけを知る
 強化学習とさまざまなキーワードの関係
 強化学習のメリット・デメリット
 強化学習における問題設定:Markov Decision Process 

Day2 強化学習の解法(1): 環境から計画を立てる
 価値の定義と算出: Bellman Equation
 動的計画法による状態評価の学習: Value Iteration
 動的計画法による戦略の学習: Policy Iteration
 モデルベースとモデルフリーとの違い

Day3 強化学習の解法(2): 経験から計画を立てる
 経験の蓄積と活用のバランス: Epsilon-Greedy法
 計画の修正を実績から行うか、予測で行うか: Monte Carlo vs Temporal Difference
 経験を価値評価、戦略どちらの更新に利用するか:Valueベース vs Policyベース

Day4 強化学習に対するニューラルネットワークの適用
 強化学習にニューラルネットワークを適用する
 価値評価を、パラメーターを持った関数で実装する:Value Function Approximation
 価値評価に深層学習を適用する:Deep Q-Network 
 戦略を、パラメーターを持った関数で実装する:Policy Gradient
 戦略に深層学習を適用する:Advantage Actor Critic (A2C)
 価値評価か、戦略か

Day5 強化学習の弱点
 サンプル効率が悪い
 局所最適な行動に陥る、過学習をすることが多い
 再現性が低い
 弱点を前提とした対応策

Day6 強化学習の弱点を克服するための手法
 サンプル効率の悪さへの対応: モデルベースとの併用/表現学習
 再現性の低さへの対応: 進化戦略
 局所最適な行動/過学習への対応: 模倣学習/逆強化学習

Day7 強化学習の活用領域
 行動の最適化
 学習の最適化(「近刊情報」より)

※発売日が変更になりました
9月2日→9月25日

目次

強化学習の位置づけを知る
強化学習の解法(環境から計画を立てる
経験から計画を立てる)
強化学習に対するニューラルネットワークの適用
深層強化学習の弱点
強化学習の弱点を克服するための手法
強化学習の活用領域

商品詳細

シリーズ名
機械学習スタートアップシリーズ
出版社名
講談社
サイズ
21cm
対象年齢
一般
フォーマット
単行本

注意事項

本の帯に関して
帯つきでの出荷はお約束しておりません。
商品ページに、帯のみに付与される特典物等の表記がある場合でも、確実に帯つきでの出荷はお約束しておりません。
また、帯は商品の一部ではなく「広告扱い」のため、帯の有無・破損による交換や返品は承っておりません。
版・表紙について
版・表紙(カバー)のご指定は承っておりません。ご注文いただくタイミングによっては、お届けする商品の版や表紙が商品ページ上のものとは異なる場合がございます。
また、初版にのみにお付けしている特典(初回特典、初回仕様特典)がある商品は、商品ページに特典の表記がされている場合でも、無くなり次第終了となります。

あなたへのおすすめ