Data
February 11, 2026 ยท View on GitHub
This directory holds data and scripts for building unified input (LoCoMo five categories + Cognitive).
Scripts
-
build_conv.py
Builds stitched dialogue contexts. For each sample inlocomo_plus.jsonit:- Randomly selects a LoCoMo conversation from
locomo10.json - Uses its session-level time axis
- Computes cue/query insertion times from
time_gap - Maps A/B in cue/query to the conversation speakers
- Inserts cue and query as new sessions
- Outputs a session-level dialogue context
You can post-process the stitched sessions for your final model input.
- Randomly selects a LoCoMo conversation from
-
unified_input.py
Merges LoCoMo (five categories) and Locomo-Plus (Cognitive) into one dataset.- LoCoMo: conversation as-is + question (no insertion).
- Cognitive: same stitching logic as
build_conv(map_speaker, time_gap, insert cue/query); no reference answer.
Writes a JSON of samples withinput_prompt,trigger,evidence,category, optionalanswer/time_gap. SetSAVE_JSON_FOR_INSPECTIONandINSPECTION_JSON_NAMEas needed.
Data files
-
locomo_plus.json
Locomo-Plus (Cognitive) samples. Each entry:cue_dialogue,trigger_query,time_gap. -
locomo10.json
Original LoCoMo conversations: multiple sessions per conversation, each with a session timestamp and list of utterances;speaker_aandspeaker_bidentify speakers. -
stitched_contexts.json (optional)
Output ofbuild_conv.py: session-level dialogue context including original sessions, inserted cue and query sessions, and metadata (e.g. cue_time, query_time, anchor utterances).