Apache Spark徹底入門

  • Apache Spark徹底入門
  • Apache Spark徹底入門
  • Apache Spark徹底入門
  • Apache Spark徹底入門
ページ数
447p
ISBN
978-4-7981-8228-5
著者情報
Damji,Jules S.(DAMJI,JULES S.)(Damji,Jules S.)
Databricks社のSenior Developer Advocateであり、MLflowのコントリビュータ。Sun Microsystems、Netscape、@Home、Loudcloud/Opsware、Verisign、ProQuest、Hortonworksなどの大手企業でソフトウェアエンジニアとして勤務し、大規模分散システムを構築。オレゴン州立大学、カリフォルニア州立大学、ジョンズ・ホプキンス大学でそれぞれコンピュータサイエンスの学士号と修士号、 Political Advocacyとコミュニケーションの修士号を取得

Wenig,Brooke(WENIG,BROOKE)(Wenig,Brooke)
顧客のために大規模な機械学習パイプラインを開発するデータサイエンティストのチームを率いるほか、分散機械学習のベストプラクティスに関するコースを指導。以前は、Databricksのプリンシパル・データサイエンス・コンサルタント。UCLAで分散機械学習を中心にコンピュータサイエンスの修士号を取得

Das,Tathagata(DAS,TATHAGATA)(Das,Tathagata)
Databricks社のスタッフソフトウェアエンジニアであり、Apache Sparkのコミッター、Apache Spark Project Management Committee(PMC)のメンバー。Apache Sparkのオリジナル開発者の一人で、Spark Streaming(DStreams)のリード開発者であり、現在はStructured StreamingとDelta Lakeのコア開発者の一人。カリフォルニア大学バークレー校でコンピューターサイエンスの修士号を取得

Lee,Denny(LEE,DENNY)(Lee,Denny)
DatabricksのStaff Developer Advocateで、Apache Sparkを0.6から使用しています。インターネットスケールのインフラ、データプラットフォーム、オンプレミスおよびクラウド環境の予測分析システムの開発で豊富な経験を持つ、実践的な分散システムおよびデータサイエンスのエンジニアです。また、オレゴン健康科学大学で生物医学情報学の修士号を取得し、企業ヘルスケア顧客向けに強力なデータソリューションを設計・実装した経験を持つ

¥4,400 税込

20 nanacoポイント

20 セブンマイル

セブン-イレブン受取り(送料無料)

発送目安

発売日(発売日以降は当日)~2日で発送

宅配(送料¥550税込)

発送目安

発売日(発売日以降は当日)~2日で発送

交通状況・天候の影響や注文が集中した場合等、お届けにお時間をいただく場合がございます。

商品説明

統合型アナリティクスエンジンの仕組みとビッグデータの大規模処理を徹底解説。基本操作からDelta LakeやMLlibを利用したパイプラインの構築まで紹介。

Apache Sparkの仕組みとビッグデータ向けの大規模処理とML開発を徹底解説

本書は、ビッグデータを主な対象としたデータ分析フレームワークであるApache Spark、MLflow、Delta Lakeの中級入門書です。「動かしてみる」だけではなく、どのような仕組みになっているのか、どうすれば効率的な実装が行えるかまで踏み込みつつ、データAIの実装者がApache Spark、MLflow およびDelta Lakeを使いこなすための解説を行います。

本書では、単純なデータ分析と複雑なデータ分析を実行し、どのように機械学習アルゴリズムを採用していくか、解説していきます。Apache Sparkの導入から解説をはじめ、Spark SQLとデータフレーム、データセットを紹介していきます。そこから、Apache Sparkを利用した実践的な機械学習の方法を解説していきます。本書での学習を通じて、次のことが学習できます。

・Python、SQL、Scala、またはJavaの高レベルの構造化APIの学習
・Spark の操作とSQLエンジンの理解
・Spark 構成とSpark UIを使用したSpark操作の検査、調整、デバッグ
・JSON、Parquet、CSV、Avro、ORC、Hive、S3、またはKafkaといったデータソースへの接続
・構造化ストリーミングを使用してバッチ データとストリーミング データの分析を実行
・オープンソースのDelta LakeとSparkを使用して信頼性の高いデータ パイプラインを構築
・MLlibを使用する機械学習パイプラインの開発、MLflowを使用するモデルの管理、本番化
・[日本語版オリジナルコンテンツ]pandas DataFrame、SparkDataFrameに関する各種データフレームの使い分け
・[日本語版オリジナルコンテンツ]LLMやEnglish SDK for SparkなどAIを活用した新たなコーディングスタイル、LLMの利用方法の実践
※本書は『Learning Spark: Lightning-Fast Data Analytics 2nd Edition』の邦訳です。

目次

1 Apache Spark入門
2 Apache Sparkのダウンロードと入門
3 Apache Sparkの構造化API
4 Spark SQLとDataFrame:組み込みデータソースの紹介
5 Spark SQLとDataFrame:外部データソースとのインタラクション
6 Spark SQLとDataset:7 Sparkアプリケーションの最適化およびチューニング
8 構造化Streaming
9 Apache Sparkを用いた信頼性の高いデータレイクの構築
10 MLlibによる機械学習
11 Apache Sparkによる機械学習パイプラインの管理、デプロイおよびスケール
12 エピローグ:Apache Spark 3.x

商品詳細

出版社名
翔泳社
サイズ
23cm
対象年齢
一般
フォーマット
単行本
原題
原タイトル:Learning Spark 原著第2版の翻訳

注意事項

本の帯に関して
帯つきでの出荷はお約束しておりません。
商品ページに、帯のみに付与される特典物等の表記がある場合でも、確実に帯つきでの出荷はお約束しておりません。
また、帯は商品の一部ではなく「広告扱い」のため、帯の有無・破損による交換や返品は承っておりません。
版・表紙について
版・表紙(カバー)のご指定は承っておりません。ご注文いただくタイミングによっては、お届けする商品の版や表紙が商品ページ上のものとは異なる場合がございます。
また、初版にのみにお付けしている特典(初回特典、初回仕様特典)がある商品は、商品ページに特典の表記がされている場合でも、無くなり次第終了となります。

あなたへのおすすめ