チーズを探しに

技術寄りの事かポエムを書く。

Kaggle Deep Past Challenge - Translate Akkadian to English でソロ銀メダル取りました

やった!ほぼ初挑戦でこれはいい方な気がする. 反省点としては,テストデータがsentence level segmentation, trainがdocument level segmentationされてて,そのままFinetuningすると無茶苦茶LBスコアが落ちるというのがあって.train.csvのラベルを捨てるという第一位の解答が示す通りFTの前の前処理をどうするかが肝だったようです. 僕はGPTでpseudoラベル作るとか試してみたんですが,あんま上手くいかず(でも上位開放の人たちは上手くやってる,,,僕の持ってたデータが数kセンテンスだったのに対し彼らが10倍ほど多いデータを収集してたみたいでデータ量の差だったみたい?). 上位陣はアッカド語がトルコあたりの言語なので,フランス語やスペイン語等の論文も収集して,GPTでpseudoラベルを作ってたみたいです.後は前処理だな...segmentationをGPTで雑にするよりその辺を丁寧にやってた人が金に乗ってる感じがしました.要はFTで性能を落とさない.

僕はFTがダメなら事前学習をやりまくろうという方針で,継続事前学習しまくる→FTで文字出力はさせれるようにするくらいに3epochほど訓練→提出,をやってました.また,モデルをメモリギリギリになるまで大きくした(ByT5 Largeがギリのるみたいだった).

nawta won a Silver Medal for placing 27th in Deep Past Challenge - Translate Akkadian to English | Kaggle