M2M_100.md

December 22, 2022 ยท View on GitHub

M2M_100

You can fine-tune a M2M_100 model from HuggingFace through model=M2M_100, model_path=<hf-or-local-path>, dataset=<dataset-name>. Specifically, M2M is a Multilingual Model. You can set source language and target language with tokenizer_kwargs={'src_lang': 'source language', 'tgt_lang': 'target_language'}.

Example usage:

python run_textbox.py \
    --model=M2M_100 \
    --model_path=facebook/m2m100_418M \
    --dataset=wmt16-ro-en \
    --tokenizer_kwargs= {'src_lang': 'ro', 'tgt_lang': 'en'}