GPT
A

Alpamayo-1.5-10B

קוד פתוח

nvidiaopenmdw-1.12026-03-03

  • safetensors
  • alpamayo1_5
  • alpamayo
  • robotics
  • en

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל ראייה ופעולה של 11 מיליארד פרמטרים לרכב אוטונומי, שמחבר וידאו מכמה מצלמות לתכנון מסלול נסיעה והסבר טקסטואלי של סיבת ההחלטה.

  • 11Bפרמטרים
  • 20.6 GBמשקל הקבצים
  • 39,092הורדות בחודש
  • 109לייקים

מה זה

הארכיטקטורה מחלקת את העבודה בין שלד ויזואלי של שמונה נקודה שניים מיליארד פרמטרים שמבוסס על Cosmos-Reason2, לבין מפענח פעולה מבוסס דיפיוז'ן של שניים נקודה שלושה מיליארד פרמטרים. הקלט מקבל ארבע מצלמות וידאו במקביל, נתוני תנועה עצמית מהעבר, והנחיות ניווט בטקסט. משם הוא מייצר מסלול נהיגה של שישים וארבע נקודות ציון קדימה לטווח של שש נקודה ארבע שניות, יחד עם שרשרת סיבתיות בטקסט שמסבירה מה הוביל לכל פנייה או בלימה.

במבחני ביצועים הוא קיבל ציון של 74.2 ב־LingoQA להסבר החלטות, וסטיית המסלול שלו במבחן פתוח על תרחישים קשים עומדת על 0.916 מטר במדד minADE לטווח המלא של שש נקודה ארבע שניות. בסימולציה סגורה ב־AlpaSim הוא נבדק על 913 תרחישים מורכבים וקיבל ציון של 1.37.

מתאים ל

  • מחקר תכנון מסלול לרכב

    הוא מייצר 64 נקודות ציון קדימה לטווח של 6.4 שניות יחד עם הסבר טקסטואלי לגבי הסיבה לכל תמרון.

  • ניתוח אירועי קצה בנהיגה

    הוא אומן על תרחישים נדירים כמו הולכי רגל מתפרצים וצמתים עמוסים כדי לבחון יכולת הסקת מסקנות.

  • הסבר החלטות בסימולטור

    המודל פולט שרשרת סיבתיות שמפרטת מה גרם להאצה או לעצירה מתוך ניתוח התמונות וההיסטוריה.

איפה זה נופל

המגבלה הכי כבדה היא הקשיחות של הפורמט. הוא אומן ונבדק כמעט אך ורק על מערך קבוע של ארבע מצלמות ברזולוציה ספציפית שנדחסת ל־320 על 576 פיקסלים, בחלון היסטוריה של 0.4 שניות בקצב עשרה הרץ, יחד עם נתוני תנועה עצמית קודמים. אם הקלטים שלכם לא מגיעים בדיוק בקצב הזה ובמבנה הזה, התוצאות לא יהיו יציבות. שרשרת ההסברים שלו מופקת באנגלית בלבד, ובגלל שמדובר במערכת קריטית לבטיחות, אנבידיה מבהירה שההרצה דורשת בדיקות מעמיקות מותאמות אישית ולא מיועדת לשליטה ישירה ברכב בלי מערכות אימות סביבה.

שאלות
נפוצות

האם אפשר להשתמש במצלמה אחת רגילה במקום ארבע?

הוא תומך עקרונית במספר מצלמות משתנה, אבל אנבידיה מציינת במפורש שהוא אומן ונבדק על מערך קבוע של ארבע מצלמות. הזנה של מצלמה בודדת תחרוג מתנאי הבדיקה ולא מומלץ להסתמך עליה.

האם המודל מבין פקודות קוליות בעברית?

לא. טקסט ההסברים שמופק וכל שרשראות הסיבתיות באו מנתוני אימון באנגלית בלבד, וזה הפורמט שבו הוא יודע לקבל הנחיות ניווט ושאלות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך אחד עם 24 גיגה־בייט זיכרון גרפי לפחות, למשל RTX 3090, RTX 4090 או כרטיסים מקבילים, כשהסביבה מבוססת לינוקס עם פייתורץ' מגרסה 2.8, טרנספורמרס ודיפ־ספיד. הבדיקות של אנבידיה עצמן נעשו על גבי H100.

אין כרגע גרסאות קטנות יותר, ומשקל הקבצים עומד על עשרים נקודה שישה גיגה־בייט. אם אתם רק בוחנים את ההיגיון הטקסטואלי ולא מתכננים להזרים ערוצי וידאו חיים מרובי מצלמות בתוך הרכב, עדיף להריץ את הניסויים על מכונה מרוחקת בענן שמחוברת לחומרה מתאימה.

pip install -U huggingface_hub
hf download nvidia/Alpamayo-1.5-10B

הרישיון

המשקלים מופצים תחת רישיון openmdw-1.1, שמתיר שימוש לא מסחרי בלבד למחקר וניסויים. קוד המקור זמין תחת רישיון Apache 2.0, אבל מי שרוצה להכניס את המודל עצמו למוצר מסחרי צריך לפנות ישירות לאנבידיה ולבקש רישיון ייעודי.

הרישיון המלא בעמוד המודל ↗