GPT
A

Alpamayo-R1-10B

קוד פתוח

nvidiaopenmdw-1.12025-11-22

  • transformers
  • safetensors
  • alpamayo_r1
  • alpamayo
  • robotics

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל נהיגה אוטונומית של עשרה מיליארד פרמטרים שמחבר הסקת מסקנות סיבתית עם תכנון מסלול מעשי. הוא פונה למי שמפתח מערכות רכב ורוצה הסברים מילוליים לצד נקודות תנועה בשטח.

  • 11Bפרמטרים
  • 20.6 GBמשקל הקבצים
  • 11,673הורדות בחודש
  • 434לייקים

מה זה

הארכיטקטורה מורכבת משני חלקים: מודל שפה חזותי בשם Cosmos-Reason עם 8.2 מיליארד פרמטרים, ומפענח תנועה מבוסס דיפיוז'ן עם 2.3 מיליארד פרמטרים. המערכת מקבלת וידאו מארבע מצלמות ברכב, היסטוריית תנועה של הרכב ופקודות טקסט, ומחזירה שני דברים במקביל. הפלט כולל שרשרת סיבתית באנגלית שמסבירה מה קורה בכביש, ומסלול תנועה עתידי של 64 נקודות לטווח של 6.4 שניות קדימה.

האימון נשען על 80,000 שעות של נתוני נהיגה מיותר ממיליארד תמונות, לצד 700,000 שרשראות הסבר סיבתיות. במבחני סימולציה בלולאה סגורה על 910 תרחישים המודל קיבל ציון של 0.73, ובהערכה פתוחה על 937 דגימות קיצון הוא הציג סטייה ממוצעת של 1.22 מטרים בחיזוי לטווח מלא. זה מראה על יכולת התמודדות סבירה עם מקרי קצה נדירים, אבל עדיין משאיר מרווח שגיאה שדורש שכבות בטיחות נוספות ברכב עצמו.

מתאים ל

  • מחקר נהיגה אוטונומית

    הוא מציע חיבור מוכן בין הסבר טקסטואלי לפעולת היגוי כדי לחקור תגובות במקרי קיצון בכביש.

  • סימולציות תנועה בלולאה סגורה

    הקוד מתממשק ישירות לכלי סימולציה כמו AlpaSim כדי לבחון התנהגות רכב לפני בדיקות שטח.

  • תיוג וניתוח נתוני נסיעה

    היכולת לייצר הסברים סיבתיים באנגלית מאפשרת להבין למה התקבלו החלטות תנועה מסוימות בהקלטות קיימות.

איפה זה נופל

המגבלה הכי קשה היא תצורת הקלט. המודל אומן ונבדק אך ורק על מערך של ארבע מצלמות ספציפיות: קדמית רחבה, קדמית צרה, ושתיים לצדדים, בחלון היסטוריה קשיח של 0.4 שניות וקצב דגימה של 10 הרץ. אם מערך החיישנים שלכם ברכב שונה, הוא פשוט לא יעבוד בלי אימון מחדש.

בנוסף, הטקסט מוגבל לאנגלית בלבד, ומערכת ההפעלה הנתמכת היא לינוקס בלבד ללא בדיקות רשמיות בסביבות אחרות. אנבידיה מבהירה שהמודל אינו מוצר נהיגה מוגמר ודורש שילוב בתוך מתודולוגיית בדיקות מלאה לפני שמזיזים איתו גלגלים.

שאלות
נפוצות

האם אפשר להשתמש במודל עם מצלמה יחידה או רחפן?

לא. המודל בנוי ומכויל ספציפית לקלט מארבע מצלמות רכב בזוויות מוגדרות יחד עם נתוני תנועה עצמית. הזנה של וידאו ממצלמה אחת לא תייצר חיזוי מסלול תקין.

האם כרטיס RTX 4090 ביתי מספיק כדי להריץ את המודל?

כן, 24GB זיכרון הווידאו של הכרטיס עומדים בדרישת המינימום הרשמית. צריך רק לוודא שמריצים על לינוקס עם גרסאות התוכנה הנדרשות של פייתורץ' ודיפ-ספיד.

איך מריצים

המודל דורש כרטיס גרפי יחיד של אנבידיה עם לפחות 24GB זיכרון וידאו, כמו RTX 3090, RTX 4090 או A5000, כשהבדיקות של החברה בוצעו על גבי H100. הקבצים שוקלים 20.6 גיגה בייט, כך שהם נכנסים במלואם לזיכרון של כרטיסים כאלה בעבודה על לינוקס.

מבחינת תוכנה צריך סביבת פייתון עם PyTorch מגרסה 2.8 ומעלה, Transformers מגרסה 4.57.1 וספריית DeepSpeed. אין כרגע שירות ענן ציבורי שמציע גישה ישירה ב־API לגרסה הזו, כך שמי שרוצה לבדוק אותה חייב להוריד את המשקולות ולהריץ את הקוד מקומית או בשרת ייעודי.

from transformers import pipeline

pipe = pipeline("robotics", model="nvidia/Alpamayo-R1-10B")
print(pipe("שלום"))

הרישיון

המשקולות מופצות תחת רישיון openmdw-1.1 שמיועד לשימוש לא מסחרי ומחקרי בלבד. קוד המקור זמין תחת רישיון Apache 2.0, אבל הטמעה של המודל בתוך מוצר מסחרי פעיל דורשת פנייה נפרדת לאנבידיה לקבלת רישוי מתאים.

הרישיון המלא בעמוד המודל ↗