File size: 514 Bytes
add5224
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
python 1_extract_video_caption_from_npz.py


python 2_build_conversations.py

python 3_extract_frames.py --dataset-root="/data/hongwei/xzh_workspace/patch_megatron_code_new/my_datasets" --time-interval=1.0 --output-json="ted_dataset_extract_frame.json" --video-token="<video>"  


python 4_convert_my_dataset_to_wds.py --dataset-root="/data/hongwei/xzh_workspace/patch_megatron_code_new/my_datasets" --json="ted_dataset_extract_frame.json" --max-samples-per-tar=10000 --train-split=9 --val-split=1 --test-split=0