GPT
R

Rex-Omni

קוד פתוח

IDEA-Researchother2025-10-09

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • vision

מודל ראייה ושפה קומפקטי שממיר משימות זיהוי עצמים לחיזוי נקודות כטוקנים. מתאים למי שרוצה זיהוי עצמים, נקודות ציון ו־OCR מקומית בלי מודלים נפרדים.

  • 4.1Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 13,961הורדות בחודש

מה זה

הפיתוח הזה מבוסס על ארכיטקטורת Qwen2.5-VL בגודל של כ־4.1 מיליארד פרמטרים. במקום להשתמש בראשי חיזוי ייעודיים ונפרדים לכל משימת ראייה ממוחשבת, הוא מתייחס לזיהוי תיחום, סימון נקודות מפתח והצבעה על אובייקטים כאל רצף של ניבויי טוקנים רגילים, בדומה למודל שפה סטנדרטי.

הוא מסוגל לקבל תמונה וטקסט, ולבצע זיהוי עצמים לפי קטגוריות טקסטואליות, פענוח טקסט מתמונה, איתור נקודות שלד והנחיה חזותית. היתרון המרכזי מול מודלים מסורתיים של ראייה ממוחשבת הוא היכולת להחליף מספר כלים שונים במודל יחיד עם ממשק שיחה והקשר נרחב של 128,000 טוקנים.

מתאים ל

  • זיהוי עצמים פתוח

    איתור קטגוריות מגוונות בתמונה לפי תיאור טקסטואלי חופשי בלי לאמן גלאי ייעודי.

  • חילוץ טקסט מתמונות

    קריאת שלטים, מסמכים וכיתובים מורכבים בתוך תמונות באמצעות יכולות ה־OCR.

  • סימון נקודות מפתח

    איתור נקודות שלד ופרטים אנטומיים באובייקטים לפי הנחיה טקסטואלית ישירה.

איפה זה נופל

הנתונים הרשמיים מגדירים את המודל בשפה האנגלית בלבד, כך שאי אפשר לבנות עליו לעיבוד תיאורים או טקסט בעברית ללא בדיקה מעמיקה. בנוסף, מודל מבוסס שפה שמייצר נקודות וקואורדינטות כטוקנים נוטה להיות איטי בהרבה מאלגוריתמי זיהוי ייעודיים, ועלול לסבול מחוסר דיוק בגבולות של תיבות תיחום צפופות.

שאלות
נפוצות

האם המודל מתאים לזיהוי עצמים בווידאו בזמן אמת?

לא ממש. ארכיטקטורה של מודל שפה מולטימודלי כבדה משמעותית מרשתות זיהוי מהירות כמו YOLO, וקצב הפריימים לשנייה יהיה נמוך בהרבה.

האם אפשר להריץ אותו על מחשב ביתי בלי שרת?

אפשר להריץ אותו על מחשב אישי עם כרטיס מסך מודרני שמכיל לפחות 12 עד 16 גיגה זיכרון תצוגה, במיוחד בעזרת vLLM.

איך מריצים

המשקל הכולל של הקבצים עומד על כ־7.6 גיגה־בייט. הרצה מקומית של המודל בפורמט המקורי תדרוש כרטיס מסך עם לפחות 16 גיגה־בייט של זיכרון וידאו כדי לטעון אותו ולעבד תמונות בנוחות, או שימוש בקוונטיזציה והרצה דרך vLLM שנתמכת בספרייה הרשמית.

מי שרק צריך לזהות עצמים סטנדרטיים במהירות גבוהה מאוד בקצב של מאות פריימים לשנייה יעדיף כנראה מודל ייעודי קלאסי. המודל הזה משתלם בעיקר כשיש צורך בגמישות של תיאורי טקסט חופשיים או בשילוב כמה יכולות שונות במקום אחד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="IDEA-Research/Rex-Omni")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת IDEA License 1.0 ובכפוף לרישיון המחקר של Qwen. מדובר ברישיון מחקרי שמגביל שימוש מסחרי חופשי, כך שמי שמתכנן לשלב אותו במוצר מסחרי צריך לבדוק את התנאים המשפטיים מול בעלי הזכויות.

הרישיון המלא בעמוד המודל ↗