
pandasのカラムに格納された同じ長さのリストを、applyとpd.Series、pop、joinを組み合わせて複数の独立したカラムに展開する方法を解説する。

pandasのカラムに格納された同じ長さのリストを、applyとpd.Series、pop、joinを組み合わせて複数の独立したカラムに展開する方法を解説する。

pandasのカラムに格納されたリストを、scikit-learnのMultiLabelBinarizerを使ってワンホットエンコードし、元のDataFrameに結合する方法を解説する。

ECサイトなどの時系列データで欠損している日付を、pandasのdate_rangeとreindexを使って一定間隔で補完する方法を解説する。

pandasとnumpyの標準偏差の計算結果が異なる原因が、自由度(ddof)のデフォルト値の違いにあることを検証し、一致させる方法を示す。

pandasでgroupby後にfilterとlambdaを組み合わせて、条件を満たすグループだけを抽出する方法を紹介する。

論文用のグラフを作成する際のmatplotlibの書式設定(フォント、目盛り、複数グラフの並置など)をテンプレートとしてまとめる。


NaNを含むndarrayにnp.meanやnp.stdを使うとnanが返される問題を、np.nanmeanやnp.nanstdで回避する方法を紹介する。

matplotlib-vennのvenn2/venn3を使って2つや3つのデータセットの重複関係を表すベン図を作成する方法を紹介する。

pandasでdropna後にSeries型の列を追加するとインデックスのずれによりNaNが混入する問題と、reset_indexによる対処法を解説する。

jupyter notebookで指定したconda環境のカーネルが正しく読み込まれない問題の原因調査と、カーネル設定ファイルの確認方法をまとめる。

pandasのgroupby結果を取り出す際、groupbyオブジェクトを直接forで回す方法が、値ごとのフィルタ処理より高速であることを実測で確認する。


回帰問題向けのLightGBMのテンプレートとして、データ取得からモデル構築、Cross Validation、テスト評価、Shapによる特徴量分析までの一連の流れをまとめる。