詳解強化学習の発展と応用 ロボット制御・ゲーム開発のための実践的理論

小林泰介/著

発売日:2024年3月

  • 詳解強化学習の発展と応用 ロボット制御・ゲーム開発のための実践的理論
  • 詳解強化学習の発展と応用 ロボット制御・ゲーム開発のための実践的理論
ページ数
212p
ISBN
978-4-910558-27-1
著者情報
小林 泰介(コバヤシ タイスケ)
2016年9月に名古屋大学大学院を短縮修了。博士(工学)取得。2016年11月から2022年3月まで奈良先端大学院大学助教。2022年4月から現在まで国立情報学研究所/総合研究大学院大学助教。その他に、2016年4月から10月まで日本学術振興会特別研究員、2018年5月から2019年3月までミュンヘン工科大学滞在研究員、2020年12月から2022年3月までJSTさきがけ研究者として従事。専門はヒューマノイドロボットを始めとする複雑なロボットの運動制御と、ロボット応用に向けた機械学習理論の開発

¥3,960 税込

18 nanacoポイント

18 セブンマイル

セブン-イレブン受取り(送料無料)

発送目安

発売日(発売日以降は当日)~2日で発送

宅配(送料¥550税込)

発送目安

発売日(発売日以降は当日)~2日で発送

交通状況・天候の影響や注文が集中した場合等、お届けにお時間をいただく場合がございます。

商品説明

【まえがき】※一部抜粋



本書では強化学習を実世界の問題に応用することを目指したい研究者(大学院生含め)や企業の技術者を主な対象にして,実応用向きの強化学習技術について紹介している.

これらは,過度に数理的な説明に踏み込みすぎずに概念的な理解を重視して説明するよう試みたつもりである.また,最近の強化学習論文では前提となっていて丁寧に紹介してもらえないテクニックや問題意識などについても適宜まとめているので,最新論文を読む下地としても有用であろう.

このように本書は,既存の強化学習ライブラリの利用方法をまとめたような入門書では満足できない,かと言って強化学習の詳細な数理に踏み込んで何故強化学習が上手く動くのかまで深く理解する段階ではない,いわば強化学習に入門を終えた強化学習ユーザー向けの構成となっている.

そのため,強化学習の基礎的な内容も本書には一応載せているが,比較的簡潔に留めたつもりである.また,本書を参考に新たな強化学習アルゴリズムの開発をすることも可能だと思うが,その際は必要に応じて他書や最新論文から理論的な補強をすると良いだろう.



本書は上記の対象を念頭に,まず1 章で強化学習の狙いや難しさを数理を一旦省いて言語的に紹介することで,大まかな思想を共有する.

その後に,その実現に必要とされる強化学習理論や最新技術の詳細を数理的に紹介していく.具体的には,2 章で強化学習の問題設定を数理的に改めるとともに,本書で必要となる幾つかの道具を紹介する.

3 章では,強化学習の最も基礎となる学習アルゴリズムと,近年の主流である深層強化学習で頻出の技術についてもまとめる.

4 章では,実世界への強化学習応用に向けた,行動として実数値を扱える強化学習手法の中の最新技術を,重要となる概念・技術とともに紹介する.

また5 章では,実世界でエージェントが効率良く学習するために有力な方法論であるモデルベース強化学習について,その基礎と応用法を分類分けしながらまとめる.

6 章では,実世界で強化学習を利用する際の恐らく最大の悩みの種となるであろう報酬の設計に関して,様々な対応策を簡潔に紹介する.最後に7 章では,筆者が今後特に期待している強化学習に関する話題を幾つか提供する.

目次

第1章 強化学習とは

1 ? 1  強化学習の目的

1 ? 2  解決すべき課題

1 ? 2 ? 1  間接的な教示

1 ? 2 ? 2  データの収集

1 ? 2 ? 3  収益の予測

参考文献


第2章 強化学習の基本的な問題設定

2 ? 1  マルコフ決定過程

2 ? 2  方策関数

2 ? 2 ? 1  離散行動空間における方策関数

2 ? 2 ? 2  連続行動空間における方策関数

2 ? 3  収益・価値関数

2 ? 3 ? 1  収益の定義

2 ? 3 ? 2  価値関数の導入

2 ? 3 ? 3  方策オン型と方策オフ型

2 ? 4  関数近似

2 ? 4 ? 1  線形関数近似

2 ? 4 ? 2  非線形関数近似

参考文献


第3章 基本的な学習アルゴリズム

3 ? 1  価値関数の学習

3 ? 1 ? 1  モンテカルロ法

3 ? 1 ? 2  TD 法

3 ? 1 ? 3  アドバンテージ関数

3 ? 2  価値関数の一般化

3 ? 2 ? 1  n ステップTD 法

3 ? 2 ? 2  TD(λ) 法

3 ? 2 ? 3  適正度履歴

3 ? 3  方策関数の学習

3 ? 3 ? 1  行動価値関数を用いたモデル

3 ? 3 ? 2  方策勾配法

3 ? 3 ? 3  Actor-Critic 法

3 ? 4  学習を支援する技術

3 ? 4 ? 1  深層学習

3 ? 4 ? 2  経験再生

3 ? 4 ? 3  ターゲットネットワーク

3 ? 4 ? 4  アンサンブル学習

参考文献


第4章 方策勾配法の発展

4 ? 1  重要なテクニック

4  ほか

商品詳細

シリーズ名
設計技術シリーズ
出版社名
科学情報出版
サイズ
21cm
対象年齢
一般
フォーマット
単行本

注意事項

本の帯に関して
帯つきでの出荷はお約束しておりません。
商品ページに、帯のみに付与される特典物等の表記がある場合でも、確実に帯つきでの出荷はお約束しておりません。
また、帯は商品の一部ではなく「広告扱い」のため、帯の有無・破損による交換や返品は承っておりません。
版・表紙について
版・表紙(カバー)のご指定は承っておりません。ご注文いただくタイミングによっては、お届けする商品の版や表紙が商品ページ上のものとは異なる場合がございます。
また、初版にのみにお付けしている特典(初回特典、初回仕様特典)がある商品は、商品ページに特典の表記がされている場合でも、無くなり次第終了となります。

あなたへのおすすめ