GPT
Y

Youtu-VL-4B-Instruct

קוד פתוח

tencentother2026-01-23

  • transformers
  • safetensors
  • youtu_vl
  • text-generation
  • image-text-to-text

מודל ראייה ושפה קומפקטי שמבצע משימות ראייה מורכבות כמו סגמנטציה והערכת עומק ישירות, בלי מודולים ייעודיים נפרדים. מתאים למי שצריך יכולות ראייה ממוחשבת עמוקות במודל קל יחסית.

  • 5.3Bפרמטרים
  • 32,768טוקנים בהקשר
  • 10.0 GBמשקל הקבצים
  • 2,321הורדות בחודש

מה זה

במקום להתייחס לתמונה רק כקלט טקסטואלי מקודד, המודל משתמש בארכיטקטורה שמתייחסת לטוקנים של תמונה וטקסט בצורה אוטורגרסיבית אחידה. הוא מתבסס על מודל שפה של 4 מיליארד פרמטרים, עם כ־5.3 מיליארד פרמטרים בסך הכול, וכולל 40 שכבות עם חלון הקשר של 32,768 טוקנים. הרעיון כאן הוא לבצע משימות ראייה קלאסיות ישירות מתוך המודל עצמו, בלי להדביק לו ראשים נפרדים לסגמנטציה או זיהוי אובייקטים.

בפועל הוא יודע לחלץ קואורדינטות של תיחום, לסמן מקטעים ספציפיים בתמונה לפי טקסט, לבצע ספירת עצמים, הערכת עומק והערכת תנוחת אדם. לצד משימות הראייה המובהקות הוא מתמודד גם עם שאלות ותשובות על תמונות, קריאת טקסט מתמונה והבנת ממשקי משתמש, מה שהופך אותו למתאים למערכות שצריכות ניתוח ויזואלי טכני מעבר לתיאור תמונה כללי.

מתאים ל

  • סגמנטציה לפי הוראה טקסטואלית

    הוא מבודד אובייקטים ספציפיים בתמונה ישירות לפי תיאור מילולי ללא מודל עזר.

  • איתור וסימון אובייקטים

    המודל מחזיר קואורדינטות מדויקות של תיבות תוחמות עבור פריטים שהוגדרו בטקסט.

  • ניתוח ויזואלי במערכות קצה

    הגודל הקומפקטי וקיומה של גרסת GGUF מתאימים לעיבוד ישיר על שרתים מקומיים.

איפה זה נופל

כרטיס המודל לא חושף את מגבלות הדיוק המדויקות שלו, אך גודל של כ־5.3 מיליארד פרמטרים מכתיב פשרות מובנות בהסקה מורכבת ובהבנת הקשרים עדינים. בנוסף, ההתקנה שלו כוללת תלויות כמו pydensecrf הדורשת הידור מ־GitHub, מה שעלול לייצר צווארי בקבוק בצינורות פריסה מודרניים. לא צוינו נתונים לגבי תמיכה בשפות שאינן אנגלית, ולכן אם אתם מתכננים לעבוד איתו בעברית תצטרכו לבדוק את היכולות שלו מראש לפני כל שילוב במערכת פעילה.

אותה משפחה

Youtu-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס והדוגמאות מתמקדים באנגלית בלבד. סביר להניח שחלוקת הטוקנים והאימון שלו לא יועדו לעברית, ולכן צריך לבדוק אותו בפועל אם הטקסט או ההוראות שלכם בעברית.

למה להשתמש בו במקום במודל ראייה סטנדרטי?

רוב המודלים בגודל הזה יודעים רק לייצר טקסט על תמונה. המודל הזה מאומן מראש להוציא גם מסיכות סגמנטציה, עומק ותיבות תוחמות באותה תשתית.

איך מריצים

המשקלים המקוריים תופסים 10 גיגה בייט בפורמט bfloat16, מה שאומר שכרטיס מסך עם 16 גיגה זיכרון יספיק כדי לטעון ולהריץ אותו בנוחות. אם אין לכם חומרה כזו, קיימת גרסת GGUF שמאפשרת להריץ אותו מכווץ על מעבדים מקומיים או זיכרון גרפי צנוע יותר. שימו לב שההתקנה דורשת ספריות ספציפיות כמו pydensecrf וגרסת transformers בין 4.56.0 ל־4.57.1, כך שצריך סביבת עבודה מבודדת כדי לא לשבור תלויות קיימות.

אם כל מה שאתם צריכים זה רק שאלות ותשובות כלליות על תמונות או הבנת מסמכים פשוטה, שימוש ב־API מבוסס ענן יהיה זול ופשוט יותר לתחזוקה. הרצה עצמית של המודל הזה משתלמת במיוחד אם אתם צריכים סגמנטציה בזמן אמת, עבודה אופליין או פרטיות מוחלטת למידע הוויזואלי שלכם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="tencent/Youtu-VL-4B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומפנה לקובץ רישיון ייעודי של Tencent. המשמעות היא שלא מדובר ברישיון קוד פתוח מוכר וסטנדרטי כמו MIT או Apache, וחובה לבדוק את התנאים המדויקים בקובץ המקור לפני כל שימוש, בעיקר אם מתכננים לשלב אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗