File size: 514 Bytes
add5224 | 1 2 3 4 5 6 7 8 9 10 11 | python 1_extract_video_caption_from_npz.py
python 2_build_conversations.py
python 3_extract_frames.py --dataset-root="/data/hongwei/xzh_workspace/patch_megatron_code_new/my_datasets" --time-interval=1.0 --output-json="ted_dataset_extract_frame.json" --video-token="<video>"
python 4_convert_my_dataset_to_wds.py --dataset-root="/data/hongwei/xzh_workspace/patch_megatron_code_new/my_datasets" --json="ted_dataset_extract_frame.json" --max-samples-per-tar=10000 --train-split=9 --val-split=1 --test-split=0
|