GPT
H

Hymba-1.5B-Instruct

קוד פתוח

nvidiaother2024-10-31

  • transformers
  • safetensors
  • hymba
  • text-generation
  • conversational

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מודל קומפקטי שמחבר שכבות קשב רגילות עם ראשי Mamba באותה שכבה. הוא פונה למי שמחפש ביצועים של מודל קטן עם זיכרון יעיל ויכולת הפעלת כלים.

  • 1.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 1,520הורדות בחודש

מה זה

המודל הזה נשען על ארכיטקטורה היברידית שלוקחת את מנגנון הקשב הרגיל ומצמידה לו שכבות SSM של Mamba במקביל. יש בו רק 3 שכבות קשב מלאות, והשאר עובדות עם חלון תשומת לב מחליק וחלוקת זיכרון בין שכבות. אנבידיה הכניסה פנימה גם טוקנים מיוחדים בתחילת הרצף שאוגרים מידע ומורידים עומס מהקשב הרגיל.

האימון כלל שילוב של דאטה פתוח להוראות יחד עם נתונים סינתטיים, ולאחר מכן כוונון בשיטות SFT ו־DPO. בגרסה הזו הוסיפו תמיכה מובנית בחישובים מתמטיים, משחקי תפקידים וקריאה לפונקציות חיצוניות ישירות דרך פורמט הפרומפט.

מתאים ל

  • הפעלת כלים מקומית

    מבנה הפרומפט כולל תמיכה מובנית ב־toolcall, והגודל הקטן מאפשר להריץ אותו ישירות על מחשב קצה.

  • פתרון בעיות מתמטיות

    הוא עבר כוונון ייעודי למשימות חישוב והיגיון מתמטי, מעבר ליכולות הרגילות של מודלים בגודל כזה.

  • סוכנים ומענה תפקיד

    הוא אומן למשחקי תפקידים ויכול לנהל אינטראקציה מובנית לפי תבנית שיחה קבועה.

איפה זה נופל

המודל רגיש למתקפות עקיפת מגבלות, ואנבידיה מציינת במפורש שמשתמשים יכולים לשבור את ההנחיות שלו בקלות יחסית. דאטה האימון שלו נאסף בחלקו מהרשת, כך שהוא עלול לייצר פלטים פוגעניים, מידע שגוי, השמטות של פרטים קריטיים ותשובות לא רלוונטיות. אם אתם מחברים אותו לפונקציות או ל־RAG שמשפיעים על מערכות אמיתיות, חובה לשים שכבת אימות קשיחה על הפלטים.

אותה משפחה

Hymba יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כל מחשב עם פייתון?

לא מיד. המודל דורש פייתורץ' 2.5 ורכיבי FlexAttention שתלויים בגרסאות CUDA ספציפיות. הדרך הכי חלקה להרים אותו בלי שגיאות קומפילציה היא דרך הדוקר הרשמי שאנבידיה פרסמה.

האם הוא בטוח לשימוש באפליקציה ציבורית מול משתמשים?

לא בלי מעטפת הגנה. אנבידיה מזהירה שהוא פגיע ל־jailbreak ועלול לפלוט מידע שגוי או פוגעני. אם אתם בונים שירות שחשוף לאינטרנט, תצטרכו להוסיף ולידציה קפדנית לכל קלט ופלט.

איך מריצים

המשקל הכולל הוא 2.8 גיגה בייט בלבד בדיוק bfloat16, כך שהוא נכנס בקלות לכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון. עם זאת, הרצה שלו דורשת סביבה מוגדרת היטב, כי הוא משתמש ב־FlexAttention שמחייב פייתורץ' 2.5 ומעלה ותמיכה בגרסאות CUDA 12.1 או 12.4. אנבידיה מציעה להשתמש ישירות באימג' דוקר מוכן כדי לא להסתבך עם התלויות.

אם אתם לא צריכים שליטה מלאה על המשקלים או חומרה מקומית, עדיף להשתמש ב־API מנוהל של מודלים גדולים יותר. ההרצה העצמית כאן משתלמת בעיקר כשרוצים אפס עלויות ענן פר קריאה, מהירות תגובה מקומית או כוונון עדין על דאטה פנימי עם ספריות כמו LMFlow.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Hymba-1.5B-Instruct")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון NVIDIA Open Model License Agreement. הרישיון מאפשר שימוש מסחרי ומחקר, אבל הוא אינו רישיון קוד פתוח רגיל כמו אפאצ'י אלא הסכם קנייני של אנבידיה. כדאי לקרוא את התנאים המשפטיים של ההסכם לפני שמשלבים אותו במוצר מסחרי סגור.

הרישיון המלא בעמוד המודל ↗