• 速習強化学習 基礎理論とアルゴリズム
  • 速習強化学習 基礎理論とアルゴリズム
ISBN
978-4-320-12422-6
著者情報
小山田 創哲(コヤマダ ソウテツ)
株式会社リクルートホールディングス

前田 新一(マエダ シンイチ)
株式会社Preferred Networks、博士(理学)

小山 雅典(コヤマ マサノリ)
立命館大学理工学部数理科学科助教、博士(数学)

¥3,300 税込

15 nanacoポイント

15 セブンマイル

セブン-イレブン受取り(送料無料)

発送目安

発売日(発売日以降は当日)~2日で発送

宅配(送料¥550税込)

発送目安

発売日(発売日以降は当日)~2日で発送

交通状況・天候の影響や注文が集中した場合等、お届けにお時間をいただく場合がございます。

商品説明

GoogleのAlphaGoによるプロ棋士打破は,人工知能がヒトを超えた学習を行った歴史的出来事として認識された。強化学習はここで重要な役割を果たしてているだけでなく,自動運転やロボット制御などの重要な分野への応用も知られ,いま世間の強い関心を集めている。その一方,日本語で強化学習を体系的に学べる教科書は多くはなく,代表的な教科書であるSutton and Barto (1998)とその訳書も出版から20年が経とうとしている。
本書はトップ会議のチュートリアルで利用されたり,2010年の出版以降わずか数年で500弱の引用がされたりという事実からも窺えるように,入門書として広く読まれている良書である。本書の内容は動的計画法などの基本的かつ重要なアルゴリズムに始まり,比較的新しい手法も体系的に網羅しつつもコンパクトに自己完結している。原著の出版から7年あまり経つが,近年の発展は本書で掲載されたアルゴリズム・アイデアをその基礎においている。特に本書では,深層学習を利用した深層強化学習を含む最近の発展に,本書で紹介されたアルゴリズムがどのように使われているかを解説した訳者補遺を追加することで,本書と最先端の研究との橋渡しをしている。

目次

第1章 マルコフ決定過程
第2章 価値推定問題
第3章 制御
第4章 さらなる勉強のために
付録A 割引マルコフ決定過程の理論
付録B TD(λ)法の前方観測的な見方と後方観測的な見方について
付録C 深層強化学習を含む最近の発展

商品詳細

出版社名
共立出版
フォーマット
単行本
原題
原タイトル:Algorithms for Reinforcement Learning

注意事項

本の帯に関して
帯つきでの出荷はお約束しておりません。
商品ページに、帯のみに付与される特典物等の表記がある場合でも、確実に帯つきでの出荷はお約束しておりません。
また、帯は商品の一部ではなく「広告扱い」のため、帯の有無・破損による交換や返品は承っておりません。
版・表紙について
版・表紙(カバー)のご指定は承っておりません。ご注文いただくタイミングによっては、お届けする商品の版や表紙が商品ページ上のものとは異なる場合がございます。
また、初版にのみにお付けしている特典(初回特典、初回仕様特典)がある商品は、商品ページに特典の表記がされている場合でも、無くなり次第終了となります。

あなたへのおすすめ