Data layout
July 28, 2026 · View on GitHub
Datasets are intentionally not included. Scripts accept explicit CLI paths; their relative defaults use the following local layout:
data/
├── longmemeval_s_cleaned.json
├── locomo10.json
├── processed/
├── reward/
└── splits/
Generated files are written below outputs/ and are ignored by Git.
Question-level reasoning evidence is generated directly from the raw LongMemEval answer sessions and the split ID files:
python data_pipeline/generate_reasoning_evidence.py \
--dataset-file data/longmemeval_s_cleaned.json \
--split-dir data/splits \
--output-dir data/reward \
--splits train val test
The resulting
data/reward/<split>/reasoning_qwen32b.split.jsonl contains one row per
question. Its reasoning_answer is copied to extra_info.required_evidence
when the GRPO parquet is built.
The GRPO launcher consumes VERL-compatible parquet files. Each row must provide
the prompt plus reward metadata in extra_info, including:
source_messagesgold_global_message_idxsquerygold_answerrequired_evidencesplit
Use data_pipeline/prepare_window_rl_data.py --help for the available input and
output path overrides.