GPT
L

Llama-3.1-Nemotron-Nano-8B-v1

קוד פתוח

nvidiaother2025-03-16

  • transformers
  • safetensors
  • llama
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווננת של מטא לחשיבה מעמיקה ושימוש בכלים, שרץ על כרטיס גרפי בודד. אנבידיה הוסיפה לו מתג מובנה לפעולת הסקת מסקנות לפי דרישה.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 76,149הורדות בחודש

מה זה

אנבידיה לקחה את בסיס ההוראות של לאמה בגודל שמונה מיליארד פרמטרים והעבירה אותו סדרת אימונים נוספת עם חיזוקים לפתרון בעיות, מתמטיקה, כתיבת קוד והפעלת כלים חיצוניים. הייחוד העיקרי הוא האפשרות לשלוט בתהליך החשיבה ישירות מההנחיה הראשית, כך שאפשר להחליט אם הוא יפלוט טוקנים של הסקת מסקנות בתגיות מיוחדות או יענה מיד.

ההבדל בביצועים בין שני המצבים חד. במבחן המתמטיקה MATH500 הוא מזנק מציון של 36.6% במצב כבוי ל־95.4% כשהחשיבה דולקת, ובמבחן הקוד MBPP הדיוק עולה מ־66.1% ל־84.6%. לעומת זאת, במשימות של עמידה בהוראות טקסטואליות פשוטות כמו IFEval, המצב הכבוי מדויק יותר ועומד על 82.1% לעומת 79.3%.

מתאים ל

  • סוכני קוד מקומיים

    תוצאה של 84.6% במבחן MBPP ויכולת חשיבה מעמיקה לפני כתיבת פונקציות, בלי להוציא קוד מהרשת המקומית.

  • פתרון בעיות מתמטיקה ומדע

    ציון של 95.4% במבחן MATH500 הופך אותו לכלי חישובי חזק שמסוגל לפרק שלבים מורכבים בתוך חומרה צנועה.

  • שילוב במערכות שליפת מידע

    התאמה מובנית לקריאת כלים וחיבור לנתונים חיצוניים מאפשרת לו לפעול כרכיב סיכום והסקה יעיל בצינור RAG.

איפה זה נופל

המודל מיועד ומאומן בעיקר לאנגלית ולשפות תכנות, לצד תמיכה חלקית בכמה שפות אירופיות, הינדי ותאי, כך שעברית לא מופיעה ברשימת השפות הנתמכות ודרושה בדיקה יסודית לפני שמנסים לעבוד איתה. בנוסף, הידע של מודל הבסיס נחתם בשנת 2023, עובדה שמחייבת חיבור למקור מידע עדכני במשימות שדורשות נתונים חדשים.

בעיה טכנית נוספת היא הנטייה של המודל להתחיל לחשוב מעצמו ולייצר תגיות חשיבה גם כשהגדרתם לו במפורש לא לעשות את זה, מה שמאלץ להזריק מראש את התשובה כדי לעקוף את הבאג.

אותה משפחה

Llama-3.1-Nemotron-Nano יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מכבים את מנגנון החשיבה אם אני צריך תשובה מהירה?

מעבירים בהודעת המערכת את המחרוזת שמורה על כיבוי החשיבה ומגדירים את הדגימה למצב חמדני. אם הוא עדיין מנסה לחשוב, מזינים מראש לתשובת העוזר תגיות חשיבה ריקות וכך סוגרים את התהליך מיד.

האם המודל יתאים לפיתוח מערכות בעברית?

התיעוד הרשמי מציין אנגלית, קוד ומספר שפות זרות ספציפיות שלא כוללות עברית. אפשר לנסות להריץ אותו, אבל סביר להניח שרמת הדיוק, ההבנה ויכולת פליטת הטקסט התקין בעברית יהיו נמוכות משמעותית.

איך מריצים

המשקל הכולל של הקבצים עומד על 15 גיגה בייט בפורמט bfloat16, כך שכרטיס RTX יחיד מסדרות 30, 40 או 50 עם מספיק זיכרון וידאו יספיק כדי לטעון אותו ישירות דרך ספריית transformers הרגילה, בתנאי שמשתמשים בגרסה 4.44.2 ומעלה.

אנבידיה מעמידה גם ממשק תצוגה מקדימה בענן שלה למי שלא רוצה להחזיק שרת ייעודי או להתעסק עם ניהול זיכרון של חלון ההקשר המלא. מי שמריץ מקומית צריך לזכור להגדיר בנפרד את הטמפרטורה, 0.6 לחשיבה פעילה או פענוח חמדני לחלוטין כשהיא כבויה, כדי לקבל תוצאות יציבות.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3.1-Nemotron-Nano-8B-v1")
print(pipe("שלום"))

הרישיון

השימוש כפוף לשני הסכמים במקביל, הרישיון הפתוח של אנבידיה והסכם הקהילה של לאמה 3.1. המודל מאושר לשימוש מסחרי באפליקציות ומוצרים, אך החוזים כוללים הגבלות שימוש והפצה ייעודיות של שתי החברות שיש לקרוא לפני הטמעה.

הרישיון המלא בעמוד המודל ↗