GPT
C

Cosmos-Reason1-7B

קוד פתוח

nvidiaother2025-04-18

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל ראייה ושפה שמיועד להבנת חוקי פיזיקה, זמן ותנועה במרחב. הוא מתאים למי שבונה רובוטיקה או ניתוח וידאו וצריך הסקת מסקנות מורכבת מתוך פריימים עוקבים.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 92,963הורדות בחודש

מה זה

בבסיס שלו נמצא Qwen2.5-VL-7B-Instruct, אבל אנבידיה אימנה אותו מחדש עם דגש כבד על בינה פיזית ורובוטיקה. הוא לוקח סרטון ותיאור טקסטואלי, מפרק אותם לטוקנים דרך מקודד ראייה, ומייצר תהליך חשיבה שלם לפני שהוא עונה על שאלות שנוגעות לתנועה, לתכנון פעולות או לאינטראקציה בין עצמים.

המבחנים מראים איפה בדיוק המיקוד שלו. במשימות כמו RoboVQA הוא מגיע לדיוק של 87.3 אחוזים וברכב אוטונומי ל־70.8 אחוזים, אבל במשימות של רובוטים כמו Agibot הוא צונח ל־48.9 אחוזים ובזיהוי כשלים ברובוטיקה ל־57.2 אחוזים. הממוצע הכולל במבחני הבנצ'מרק עומד על 65.1 אחוזים, מה שמראה שהבנת סיטואציות מורכבות של זרועות מכניות עדיין רחוקה מלהיות פתורה לגמרי.

מתאים ל

  • תכנון פעולות לרובוטים

    פירוק משימות פיזיות לשלבים הגיוניים על בסיס וידאו נכנס והבנת הסביבה.

  • ניתוח וידאו תעשייתי

    זיהוי גורמי שורש של תקלות ואירועים חריגים מתוך צילומי מצלמות אבטחה ותפעול.

  • תיוג דאטה לנהיגה אוטונומית

    אוטומציה של יצירת הסברים והבנת תנועה עבור צילומי דרך בקצב של ארבעה פריימים לשנייה.

איפה זה נופל

המודל נופל בסצנות מורכבות של וידאו. הכרטיס מציין במפורש קושי בתנועות מצלמה מהירות, אינטראקציות חופפות בין אדם לחפץ, תאורה חלשה עם מריחות תנועה, ומצבים שבהם כמה אנשים מבצעים פעולות שונות במקביל. בנוסף, הוא נבדק רק באנגלית, כך שכל הנחיה בעברית עלולה להניב תוצאות לא צפויות.

שאלות
נפוצות

אפשר להריץ אותו על מחשב מקומי עם כרטיס RTX?

הכרטיס נבדק רק על ארכיטקטורות Hopper ו־Blackwell עם כרטיסים מקצועיים כמו A100 ו־H100 תחת לינוקס. אפשר לנסות להעלות אותו על חומרה צרכנית שתומכת ב־bfloat16 ויש לה מספיק זיכרון, אבל אנבידיה לא תומכת בכך רשמית.

האם הוא יודע לעבד וידאו חי בזמן אמת?

לא מומלץ למשימות זמן אמת קריטיות. המודל בנוי לייצר תהליך חשיבה ארוך ומפורט של אלפי טוקנים לפני מתן התשובה, כך שזמן התגובה שלו איטי בהשוואה למודלי ראייה קלאסיים.

איך מריצים

המודל דורש vLLM ורץ בסביבת לינוקס בלבד, כאשר אנבידיה בדקה אותו על חומרות Hopper ו־Blackwell, וספציפית על כרטיסי A100, H100 ו־GB200 בדיוק bfloat16. קובצי המשקולות תופסים 15.5 גיגה בייט, כך שכרטיס בודד של 24 גיגה בייט יחזיק את המודל, אבל דרישות הריצה קשוחות בגלל הווידאו.

אימון המודל הותאם לקצב של 4 פריימים לשנייה, ואנבידיה מציינת במפורש שצריך להגדיר תקרה של לפחות 4096 טוקנים לתשובה כדי למנוע קטיעה של תהליך ההסקה. אם אין ברשותכם גישה לשרת עם כרטיסי שרת של אנבידיה, עדיף לחפש נקודת קצה מנוהלת ולא לנסות להריץ אותו מקומית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nvidia/Cosmos-Reason1-7B")
print(pipe("שלום"))

הרישיון

הרישיון הוא NVIDIA Open Model License שמתיר שימוש מסחרי ויצירת נגזרות, ואנבידיה לא דורשת בעלות על הפלטים. המלכוד המשמעותי הוא סעיף אכיפה שמבטל את הרישיון אוטומטית אם עוקפים, מנטרלים או מפחיתים את היעילות של מנגנוני הגנה ובטיחות שהוטמעו במודל בלי להציב חלופה הולמת.

הרישיון המלא בעמוד המודל ↗