Video-Text-to-Text
Transformers
Safetensors
qwen2_5_omni
multimodal
video-understanding
audio-understanding
streaming
real-time
omni-modal
Instructions to use EurekaTian/ROMA with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use EurekaTian/ROMA with Transformers:
# Load model directly from transformers import AutoProcessor, AutoModel processor = AutoProcessor.from_pretrained("EurekaTian/ROMA") model = AutoModel.from_pretrained("EurekaTian/ROMA", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "additional_special_tokens": [ | |
| "<|im_start|>", | |
| "<|im_end|>", | |
| "<|AUDIO|>", | |
| "<|audio_bos|>", | |
| "<|audio_eos|>", | |
| "<|box_end|>", | |
| "<|quad_start|>", | |
| "<|quad_end|>", | |
| "<|vision_bos|>", | |
| "<|vision_eos|>", | |
| "<|vision_pad|>", | |
| "<|IMAGE|>", | |
| "<|VIDEO|>" | |
| ], | |
| "audio_bos_token": "<|audio_bos|>", | |
| "audio_eos_token": "<|audio_eos|>", | |
| "audio_token": "<|AUDIO|>", | |
| "eos_token": { | |
| "content": "<|im_end|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| }, | |
| "image_token": "<|IMAGE|>", | |
| "pad_token": { | |
| "content": "<|endoftext|>", | |
| "lstrip": false, | |
| "normalized": false, | |
| "rstrip": false, | |
| "single_word": false | |
| }, | |
| "video_token": "<|VIDEO|>", | |
| "vision_bos_token": "<|vision_bos|>", | |
| "vision_eos_token": "<|vision_eos|>" | |
| } | |