GPT
C

C-RADIOv4-SO400M

קוד פתוח

nvidiaother2026-01-26

  • transformers
  • safetensors
  • feature-extraction
  • custom_code

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

חילוץ מאפיינים ויזואליים שמזקק יחד שלושה מודלים כבדים לתוך משקל יחיד. הוא מתאים למי שבונה מודל שפה ויזואלי או סגמנטציה ורוצה דיוק גבוה בלי להחזיק מפלצת בזיכרון.

  • 431Mפרמטרים
  • 2.7 GBמשקל הקבצים
  • 6,190הורדות בחודש
  • 42לייקים

מה זה

במקום להריץ בנפרד מודלים שונים כדי לקבל גם הבנה כללית של תמונה וגם חדות ברמת הפיקסל, המודל הזה אומן בשיטת זיקוק משלושה מודלים מקבילים: SigLIP2-g, DINOv3-7B ו־SAM3. התוצאה היא רשת בגודל 431 מיליון פרמטרים שמספקת שני פלטים במקביל, וקטור סיכום לכל התמונה ומערך מאפיינים מרחבי ששומר על מיקום האובייקטים.

במבחני סגמנטציה על ADE20k הוא מגיע לציון 55.14 mIoU, וב־Pascal VOC ל־87.22. המספרים האלה מראים שהוא כמעט זהה בביצועים לגרסת ה־Huge ששוקלת 653 מיליון פרמטרים, מה שאומר שברוב המקרים הגרסה הזו נותנת תמורה טובה יותר מבחינת יחס ביצועים לגודל, בלי לשלם על עוד 220 מיליון פרמטרים.

מתאים ל

  • אימון מודל שפה ויזואלי

    חילוץ טוקנים מרחביים עשירים מתוך תמונות כדי לחבר אותם ישירות לשכבות הקלט של מודל שפה.

  • סגמנטציה סמנטית מדויקת

    המבנה שומר על חלוקה לרשת של 16 פיקסלים ומספק ייצוג לוקאלי חזק שמתאים למשימות צביעת עצמים.

  • מיון וסינון מאגרי תמונות

    וקטור הסיכום הכללי מייצג את מהות התמונה ומאפשר חיפוש דמיון מהיר ללא צורך בהרצת מודלי ענק.

איפה זה נופל

הוא לא מחזיר טקסט, קטגוריות או תשובות, אלא טנסורים גולמיים בלבד. כדי לעשות איתו משהו מעשי חייבים לאמן מעליו שכבה נוספת, כמו מסווג ליניארי או מפענח סגמנטציה. הוא נבדק רק על רזולוציות שבין 256 ל־2048 פיקסלים ובקפיצות מדויקות של 16 פיקסלים. התיעוד מודה בפירוש שהמודל מתקשה לעיתים בזיהוי כיווניות של אובייקטים, למשל כיוון של תמרור, ועלול להיכשל בהבחנה בין פריטים דומים מאוד מאותו סוג, כמו גזעים שונים של כלבים.

שאלות
נפוצות

האם המודל יכול לסווג תמונות ישר מהקופסה?

לא. המודל מחזיר רק מאפיינים מתמטיים בצורת טנסור, ואין לו שכבת פלט שמצביעה על קטגוריה כמו חתול או רכב. כדי לסווג תמונות תצטרכו להוסיף מעליו שכבת סיווג ולאמן אותה על הנתונים שלכם.

באיזה גודל תמונה אפשר להשתמש?

המודל תומך ברזולוציות מ־256 עד 2048 פיקסלים, אבל מידות התמונה חייבות להתחלק ב־16 ללא שארית. תמונות שלא מתאימות לטווח הזה או למדרגות הפיקסלים האלו יצטרכו לעבור התאמת גודל בעזרת מעבד התמונה לפני ההזנה לרשת.

איך מריצים

טעינת המודל מתבצעת ישירות דרך ספריית transformers של פייתון עם הדגל trust_remote_code. קבצי המשקולות תופסים 2.7 גיגה בייט בדיוק של float32, כך שכרטיס מסך בסיסי עם 8 עד 12 גיגה בייט של VRAM יריץ אותו בקלות. אנבידיה תומכת בו בארכיטקטורות שונות, ממעבדי Jetson משובצים ועד מעבדי שרתים כמו Hopper ו־Blackwell, וניתן להאיץ אותו באמצעות מנועי TensorRT.

יש למשפחה הזו גם גרסת Huge גדולה יותר, אבל הפער בתוצאות קטן מאוד ולכן עדיף להישאר עם הגרסה הזו. אם אתם רק צריכים סיווג בסיסי של תמונות פעם בכמה שעות, עדיף להשתמש בפתרון ענן קיים, אבל אם המערכת שלכם מעבדת וידאו או דורשת זמני תגובה מהירים מקומית, הרצה עצמית כאן פשוטה וזולה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="nvidia/C-RADIOv4-SO400M")
print(pipe("שלום"))

הרישיון

השימוש כפוף להסכם NVIDIA Open Model License מחודש יוני 2024. הרישיון מתיר שימוש מסחרי ושימוש לא מסחרי, אך כולל תנאים והגבלות ספציפיים שמופיעים בהסכם של אנבידיה. לפני שילוב שלו במוצר מסחרי צריך לוודא שהשימוש שלכם עומד בכל תנאי הרישיון המקורי.

הרישיון המלא בעמוד המודל ↗