GPT
H

Hymba-1.5B-Base

קוד פתוח

nvidiaother2024-10-09

  • transformers
  • safetensors
  • hymba
  • text-generation
  • conversational

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל בסיס קטן של אנבידיה שמשלב שכבות קשב רגילות עם ראשי Mamba במקביל. הוא מכוון לביצועים חזקים במיוחד תחת מגבלת זיכרון צפופה.

  • 1.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 786הורדות בחודש

מה זה

מדובר במודל שפה של 1.5 מיליארד פרמטרים שמנסה לפתור את צוואר הבקבוק המוכר של זיכרון במודלים קטנים. במקום להסתמך רק על ארכיטקטורת טרנספורמר רגילה, אנבידיה שילבה כאן בתוך אותה שכבה ראשי קשב סטנדרטיים יחד עם ראשי SSM של Mamba. מתוך 32 השכבות, רק שלוש מריצות קשב מלא, והשאר משתמשות בחלון מחליק לצד שיתוף של זיכרון ה־KV בין שכבות שונות ובין ראשים. בנוסף, המודל מחבר טוקנים לומדים מיוחדים בתחילת כל קלט כדי להפחית עומס מחישובי הקשב הרגילים.

לפי הדיווח של אנבידיה, השילוב ההיברידי הזה עוקף את כל מודלי הקוד הפתוח האחרים בקטגוריה של עד שני מיליארד פרמטרים. בפועל, המשמעות של התכנון הזה היא דרישת זיכרון נמוכה בהרבה בזמן ריצה, לצד יכולת לשמור על הקשר סביר של 8,192 טוקנים בלי לקרוס תחת עלויות החישוב.

מתאים ל

  • בסיס לכוונון משימות ייעודיות

    מתאים לאימון המשך על נתונים פנימיים עם ספריות כמו LMFlow וטכניקות LoRA יעילות.

  • הסקה על חומרת קצה מוגבלת

    משקל של 2.8 גיגה בייט ושיתוף זיכרון KV מאפשרים להריץ אותו ישירות על מחשבים פשוטים.

  • ניסויי ארכיטקטורה היברידית

    בדיקת השילוב בין Mamba למנגנוני קשב במחקרים פנימיים לפני מעבר למודלי ענק.

איפה זה נופל

זהו מודל בסיס ולא מודל שעבר התאמה לשיחה, ולכן הוא לא מתאים לשימוש ישיר מול משתמשים בלי כוונון מקדים. אנבידיה מודה במפורש בתיעוד שהמודל אומן על מידע מהאינטרנט שכולל שפה פוגענית והטיות, והוא עלול לייצר טקסט רעיל, שגוי או להשמיט עובדות חשובות. מעבר לזה, המודל פגיע למתקפות עקיפת מגבלות. אם אתם בונים מערכת סוכנים או שליפת מידע שמזינה קלט משתמש ישירות למודל, חובה לשים שכבות סינון ובקרה קשיחות ביציאה.

אותה משפחה

Hymba יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר לפתוח איתו שיחה ישר אחרי שמורידים אותו?

לא מומלץ. מדובר במודל בסיס שמשלים טקסט ולא עבר אימון הנחיות או יישור להתנהגות צ'אט, ולכן הוא לא יענה בצורה מובנית לשאלות ישירות בלי כוונון מקדים.

למה הוא דורש הגדרות סביבה מיוחדות במקום pip install רגיל?

הארכיטקטורה נשענת על FlexAttention וראשי Mamba שמחייבים גרסאות מסוימות של PyTorch 2.5 ותלויות CUDA ספציפיות, ולכן אנבידיה מספקת סקריפט התקנה ייעודי ותמונת דוקר מוכנה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם תמיכה ב־CUDA 12.1 או 12.4 ופייתון עם PyTorch 2.5, בעיקר בגלל התלות במנגנון FlexAttention. הקבצים שוקלים כ־2.8 גיגה בייט בדיוק של bfloat16, כך שכרטיס מסך ביתי מודרני עם שמונה או שנים עשר גיגה זיכרון מריץ אותו מקומית בלי בעיה מיוחדת. אנבידיה מציעה תמונת דוקר מוכנה כדי לחסוך את כאב הראש של התקנת התלויות הייחודיות, וטעינה ישירה דרך transformers דורשת להפעיל trust_remote_code.

אם אתם לא מתכוונים לאמן אותו או להריץ אותו בסביבת קצה מקומית, הקמה של סביבה כזו מאפס בשביל כמה שאילתות בודדות היא התעסקות מיותרת, ועדיף פשוט לצרוך מודל גדול יותר דרך ספק ענן חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Hymba-1.5B-Base")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון NVIDIA Open Model License Agreement, שמוגדר כרישיון מותאם אישית ומאפשר שימוש מסחרי. עם זאת, לפני שמטמיעים אותו במוצר מסחרי, חובה לקרוא את נוסח ההסכם המלא של אנבידיה ולוודא שהשימוש שלכם עומד בכל ההגבלות המשפטיות והתנאים הספציפיים שהם מחילים על שימוש במודלים פתוחים שלהם.

הרישיון המלא בעמוד המודל ↗