GPT
C

C-RADIOv4-H

קוד פתוח

nvidiaother2026-01-26

  • transformers
  • safetensors
  • feature-extraction
  • custom_code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

חילוץ וקטורים מתמונות שממזג יכולות של SigLIP2, DINOv3 ו־SAM3 לרשת אחת. מתאים למי שבונה סגמנטציה או חיפוש ויזואלי ורוצה איכות גבוהה בלי להריץ שלושה מודלי ענק במקביל.

  • 652Mפרמטרים
  • 4.0 GBמשקל הקבצים
  • 32,496הורדות בחודש
  • 82לייקים

מה זה

במקום לאמן עוד מודל ראייה מאפס, אנבידיה לקחה נתונים מ־700 מיליון תמונות ואימנה את הרשת הזו לזקק ידע משלושה מודלים מובילים: SigLIP2-g להבנה טקסטואלית, DINOv3-7B למיפוי תכונות גלובלי, ו־SAM3 להבנת גבולות של עצמים. הארכיטקטורה מבוססת Vision Transformer ומחזירה שני פלטים נפרדים: וקטור סיכום לכלל התמונה בדומה לטוקן CLS, ומערך טוקנים מרחבי לפי פאצ'ים בגודל 16 פיקסלים שמיועד למשימות צפופות.

במדדי ImageNet המודל מגיע ל־83.09% בדיוק אפס צעדים ו־86.68% ב־KNN, שזה שיפור עקבי מול גרסאות v3 הקודמות. בסגמנטציה סמנטית על ADE20k הוא מקבל 55.20 mIoU ועל Pascal VOC מגיע ל־87.24 mIoU כשמאמנים מעליו שכבה ליניארית בלבד. זה אומר שהווקטורים שהוא פולט מחזיקים מספיק מידע גיאומטרי וסמנטי מוכן, כך שלא חייבים כוונון עדין כבד של כל הרשת כדי לקבל תוצאות חזקות.

מתאים ל

  • סגמנטציה סמנטית

    פלט התכונות המרחבי שומר על גבולות עצמים ברזולוציה של פאצ'ים ומאפשר אימון שכבה ליניארית קלה בלבד מעליו.

  • אינדוקס וחיפוש ויזואלי

    וקטור הסיכום של התמונה מאחד ידע של מודלי שפה-תמונה ומודלים ללא הנחיה לתוך ייצוג יחיד וקומפקטי.

  • מפענח ראייה למודלי שפה

    מזין טוקנים ויזואליים עשירים ומדויקים ישירות לתוך LLM כדי להוסיף לו יכולות עיבוד תמונה מתקדמות.

איפה זה נופל

הכרטיס מדגיש במפורש שהמודל נוטה לפספס כיווניות של עצמים, כמו שלטי תנועה שמורים ימינה או שמאלה. הוא לא מייצר טקסט ולא מסווג תמונות לבדו, אלא פולט וקטורים בלבד שמחייבים מודל המשך. בנוסף, הוא עלול להיכשל בהבדלה בין ישויות דומות שנראות ברורות לאדם, כמו גזעי כלבים שונים, וביצועיו ייפלו בסביבות ויזואליות שלא נכללו בדאטה-סט המקורי. חובה גם לשמור על רזולוציות קלט שמתחלקות ב־16 ובטווח שבין 256 ל־2048 פיקסלים בלבד.

שאלות
נפוצות

האם אפשר להעביר למודל תמונה ולקבל תיאור טקסטואלי?

לא. המודל מחזיר אך ורק טנזורים של וקטורים מספריים. כדי לקבל תיאור, קטגוריה או זיהוי, אתם חייבים לחבר את הפלט לרשת סיווג נפרדת או למודל שפה.

מה ההבדל המעשי בין גרסת ה־H לגרסת ה־SO400M?

גרסת ה־H גדולה יותר בכ־222 מיליון פרמטרים, אבל מבחינת תוצאות המדידה הפער קטן מחצי אחוז ברוב המשימות. לרוב היישומים גרסת ה־400M תהיה משתלמת יותר מבחינת זיכרון ומהירות ריצה.

איזה גודל תמונה אפשר להזין למודל?

הרזולוציה הנתמכת נעה בין 256 ל־2048 פיקסלים, כאשר מידות התמונה חייבות להתחלק ב־16 פיקסלים בדיוק בגלל גודל הפאץ' של הרשת.

איך מריצים

טוענים את המשקלים דרך transformers בעזרת AutoModel ו־CLIPImageProcessor, כאשר חובה להגדיר trust_remote_code כיוון שמדובר בארכיטקטורת RADIO מותאמת. הקבצים שוקלים 4.0 גיגה בייט בדיוק float32. עם 653 מיליון פרמטרים תצטרכו כרטיס מסך עם לפחות 12 עד 16 גיגה בייט זיכרון וידאו עבור תמונות בודדות, והרבה יותר מזה אם אתם מעבדים באצ'ים או עולים לרזולוציה המקסימלית של 2048 על 2028.

למודל יש גם גרסה קטנה יותר בשם SO400M עם 431 מיליון פרמטרים. ההבדלים בביצועים ביניהן קטנים מאוד: ב־ADE20k מדובר על 55.14 מול 55.20, ועל Pascal VOC כמעט שאין פער. אם הזיכרון או זמני השיהוי לוחצים עליכם, עדיף לבחור בגרסת ה־400M. שירותי ענן של ספקים חיצוניים עדיפים בעיקר כשאין לכם חומרת אנבידיה מקומית, כי המודל הזה בנוי ומואץ ספציפית עבור ספריות CUDA ו־TensorRT.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="nvidia/C-RADIOv4-H")
print(pipe("שלום"))

הרישיון

הרישיון הוא NVIDIA Open Model License Agreement מיוני 2024. אנבידיה מצהירה במפורש שהמודל מוכן לשימוש מסחרי ולא מסחרי ברחבי העולם. יחד עם זאת, מדובר בהסכם ייעודי של אנבידיה ולא ברישיון קוד פתוח סטנדרטי דוגמת Apache או MIT, ולכן שילוב שלו במוצר מסחרי מחייב קריאה של תנאי ההסכם המלאים ומגבלות השימוש המוגדרות בו.

הרישיון המלא בעמוד המודל ↗