· 2分で読了
ゼロから始めるデータサイエンスの旅
この記事は中国語から自動翻訳されたものです。翻訳によりニュアンスが失われている場合があります。
はじめに
せっかく会社にかなり整った機械学習とデータ分析のチームがあり、リソースやパイプラインも比較的充実しているので、この機会にデータサイエンスの知識を学びつつ、分からないことがあれば同僚たちに直接聞いてみようと思う。データサイエンスの範囲は非常に広く、今のところ明確な方向性があるわけではないが、学びながらどんな面白い化学反応が起きるか見てみよう。スラッシャーとして幅を広げていくぞ!
計画
-
大学の統計の授業で抜け落ちたピースを取り戻す(2 weeks)
- 分布と各種検定手法
- R:復習の過程で並行して学ぶ
-
線形代数を復習する(3 weeks)
- 完全に全部忘れてしまった
-
アンドリュー・ンの機械学習コースを復習する(1 week)
- 僕が受講したときは Octave を使っていたが、概念は共通しているはずだ
-
Coursera Deep Learning Specialization(6 weeks)
-
以前買ったデータサイエンスの本を読み切る(3 weeks)
-
fast.ai の進捗に沿って進めつつ、論文を読み漁る
- 以前 1〜4 を見終えたが完全に忘れた。
-
データエンジニアリング
- Airflow
- Kafka
- 個人的にこの2つを学びたい
これでだいたい100日はかかるだろう。データ分析関連の講座ももう少し探して受講するかもしれない。今は機械学習とディープラーニングが多めな気がする。とりあえず忘れないように、今思いついたことをここに記録しておく。
目標
一番は、フロントエンドとデータサイエンスを組み合わせて何か面白いことができないか見てみたいという点だ。ml.js や tensorflow.js との統合などはとても面白そうだ。
もう一つは、自分の中にあるアイデアのいくつかにデータサイエンスの助けが必要なため、比較的時間がある今のうちにこのあたりの知識を補っておきたいということだ。以前勉強したときはノートがあちこちに散らばっていて今ではほとんど見つからず、大半を忘れてしまったので、今回はしっかりブログに記録していこうと思う。
関連記事
- 測定が目標になるとき:窓税からPull Request数まで かつて僕は小さなツールを自作し、四半期で自分がどれだけPRに貢献したか、レビューコメントをどれだけ残したか、チケットをどれだけ消化したかを集計して、上司にアウトプットを証明しようとしたことがある。上司は淡々と、評価はアウトプットだけで見るものではないと言った。数年後、僕はようやく理解した――測定が目標になるとき、それはもはや良い測定ではなくなるのだ。英国の窓税、ハノイのネズミ駆除の報奨金から、現代のPR数による開発者評価に至るまで、そのメカニズムはまったく同じだ。
- Cloudflare Images を画像ストレージ・変換ソリューションとして使う ウェブページに画像を1枚置くのはフロントエンドにとって最も簡単なことだが、リサイズや各種フォーマットの生成、さらにはトラフィックの負荷に耐えることまで完璧にやろうとすると、実際には一つの包括的なソリューションが必要になる。僕はその後、すべて Cloudflare Images に任せるようになり、オリジナル画像1枚だけを渡すようにしている。
- もう AWS Access Key を使うのはやめよう Access Key は AWS において見落とされがちなセキュリティリスクだ。OIDC と IAM Role を組み合わせることで、GitHub Actions にシークレットを一切保持させることなく、安全に AWS リソースを操作できるようにする。
- データベース主キー:AUTO_INCREMENT、UUID、そしてUUIDv7 バックエンド開発で度々直面する主キーの決定。auto incrementを使うべきか、それともUUIDか?衝突への懸念は?UUIDv7とcreated_at + インデックスの性能差はどれほどか?実際に2,000万件のデータで検証したベンチマークと設計上の意思決定を解説する。