GPT
N

Nemotron-H-8B-Base-8K

קוד פתוח

nvidiaother2025-03-19

  • transformers
  • safetensors
  • nvidia
  • pytorch
  • nemotron-h

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ארכיטקטורה היברידית של שכבות Mamba-2 עם ארבע שכבות תשומת לב בלבד יוצרת מודל שונה מהנוף הרגיל. אם אתם מחפשים בסיס קל יחסית עם צריכת זיכרון מופחתת בהסקה, הוא בהחלט מסקרן.

  • 8.1Bפרמטרים
  • 30.2 GBמשקל הקבצים
  • 68,887הורדות בחודש
  • 60לייקים

מה זה

המודל הזה מבוסס על שילוב ייחודי בין Mamba-2 לבין שכבות MLP, כשביניהן פזורות רק ארבע שכבות Attention רגילות. המטרה של המבנה ההיברידי הזה היא לתת מהירות הסקה וחיסכון במשאבים שאופייניים למודלים מבוססי מצב, בלי לאבד את יכולת ההקשר והדיוק שטרנספורמר מלא נותן. הוא אומן על טקסטים בשפות שונות, כולל שימוש בדאטה סינתטי מבית Qwen, ומתמקד בהשלמת טקסט כללית באורך הקשר שמגיע עד 8K.

במדדי ההערכה הוא מציג תוצאות מעורבות. במבחני הבנה וידע כללי כמו ARC עם ציון של 88.74 ו־GSM8K עם 87.11 הוא עומד יפה ביחס לגודל שלו, אבל כשמגיעים לקוד ומבחנים מורכבים יותר התמונה משתנה. ב־HumanEval ללא דוגמאות הוא מקבל 58.54 בלבד, וב־MATH ברמה 5 הקשה הוא צונח ל־22.93, מה שאומר שפתרון בעיות חישוביות מעמיקות או כתיבת פונקציות מורכבות מאפס ידגמו ביצועים בינוניים מאוד.

מתאים ל

  • בסיס לאימון והתאמה אישית

    מתאים למי שרוצה לבצע LoRA או יישור מבוסס NeMo למשימות פנימיות בארגון.

  • מחקר על ארכיטקטורות שילוב

    פלטפורמה מצוינת לבחינת התנהגות שכבות Mamba-2 מול Attention קלאסי.

  • השלמת טקסט טכני רב-לשוני

    יעיל לעיבוד מסמכים בשפות אירופיות ומזרח אסייתיות שנתמכות במפורש.

איפה זה נופל

זהו מודל בסיס בלבד, ללא כוונון שיחה או הוראות, כך שהוא ינסה רק להשלים טקסט ולא יענה כמו צ'אטבוט מוכן. לפי התיעוד הוא רגיש להזרקות פרומפטים עקיפות בקידודים שונים כמו Base16, הקס וברייל, גם אם הוא עמיד יחסית ל־Base64. בנוסף, עברית לא מופיעה ברשימת השפות הנתמכות, ונתוני האימון נעצרו בספטמבר 2024, כך שחסר לו כל ידע על אירועים מאוחרים יותר.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כצ'אטבוט לפניות משתמשים?

לא. זהו מודל בסיס שנועד להשלמת טקסט ולא עבר אימון הנחיות או שיחה. כדי לקבל מענה לשאלות תצטרכו קודם לאמן אותו בעזרת SFT או שיטות דומות.

האם המודל מבין ומייצר עברית בצורה אמינה?

השפה העברית אינה ברשימת השפות שנתמכות בכרטיס המודל. ייתכן שהוא יפלוט מילים בודדות אם נתקל בהן באינטרנט, אך הוא לא אומן עבורה ולא מומלץ להסתמך עליו בטקסטים מקומיים.

איך מריצים

כדי להריץ אותו דרך Hugging Face transformers צריך להפעיל את trust_remote_code כי מדובר בארכיטקטורה לא סטנדרטית. הקבצים עצמם שוקלים 30.2 ג'יגה בייט, ובדיוק של bfloat16 תצטרכו כרטיס עם לפחות 24GB של VRAM כדי לטעון אותו בנוחות ולהשאיר מרווח לעבודה. בכרטיס המודל נבדק ואושר בעיקר על חומרת שרתים כמו NVIDIA A100 ו־H100-80GB תחת לינוקס וסביבת NeMo 24.12.

אם אין לכם כרטיס כזה זמין מקומית או שרת ייעודי, עדיף לפנות ל־API מנוהל שמחזיק מודלי שפה או להשתמש במכונה בענן לפי שעה, אחרת הטעינה וההסקה בסביבה ביתית פשוט יקרסו מחוסר זיכרון.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-H-8B-Base-8K")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא רישיון ייעודי של אנבידיה למחקר ופיתוח מדעי פנימי בלבד. הוא אינו מאפשר שימוש מסחרי ישיר ואינו מתאים לשילוב במוצר חי שנמכר ללקוחות. מותר להוריד, לחקור, לבצע התאמות עדינות ולבדוק ביצועים במעבדה, אך לכל דבר שמיועד לפרודקשן תידרשו לבדוק פתרונות אחרים או הסכמים נפרדים.

הרישיון המלא בעמוד המודל ↗