GPT
L

Llama-3.1-Nemotron-Nano-4B-v1.1

קוד פתוח

nvidiaother2025-05-03

  • transformers
  • safetensors
  • llama
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

זה מודל קטן של 4.5 מיליארד פרמטרים שמביא יכולות חשיבה וקריאה לכלים. הוא מתאים למי שרוצה להריץ סוכן מקומי על כרטיס גרפי בודד בלי לשלם על API חיצוני.

  • 4.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 8.4 GBמשקל הקבצים
  • 3,848הורדות בחודש

מה זה

מדובר בגרסה מכווצת של Llama 3.1 8B שעברה חיתוך וזיקוק, ולאחר מכן אימון ייעודי למשימות חשיבה, כתיבת קוד והפעלת כלים. הדבר המרכזי כאן הוא מתג חשיבה מובנה בפרומפט המערכת. אפשר להורות לו לחשוב לעומק או לענות ישירות, מה שמשפיע דרמטית על התוצאות.

ההבדל בביצועים בולט מאוד. במבחן המתמטיקה MATH500 הוא מזנק מציון של 71.8% כשהחשיבה כבויה ל־96.2% כשהיא מופעלת, ובמבחן התכנות MBPP הוא עולה מ־61.9% ל־85.8%. הוא תומך בהקשר של עד 131,072 טוקנים, נתון נדיר למודלים במשקל נוצה כזה, שמכוון ישירות לעבודה עם מסמכים ארוכים ומערכות שליפת מידע.

מתאים ל

  • סוכנים אוטונומיים מקומיים

    הוא מגיע עם פרסר מובנה להפעלת כלים ורץ על כרטיס מסך ביתי יחיד.

  • פתרון בעיות מתמטיקה ותכנות

    מצב החשיבה המובנה מקפיץ את הדיוק באלגוריתמיקה בלי צורך במודל ענק.

  • שליפת מידע ממסמכים ארוכים

    חלון הקשר של 128 אלף טוקנים מאפשר להזין תיעוד טכני נרחב בבת אחת.

איפה זה נופל

האימון המקדים של המודל נעצר ביוני 2023, כך שהוא לא מעודכן באירועים שקרו מאז בלי שתזרימו לו מידע עדכני. נקודה בעייתית נוספת היא שלפעמים המודל מתעקש לחשוב ולהאריך בדברים גם כשמכבים את מנגנון החשיבה בהגדרות, מה שמחייב מפתחים לשתול מראש תגיות סגירה של הבלוק כדי לא לבזבז זמן וטוקנים. בנוסף, עברית כלל לא מופיעה ברשימת השפות הנתמכות בכרטיס, שכוללת בעיקר אנגלית, קוד ומספר שפות אירופיות ואסיאתיות, ולכן הוא לא מתאים ליישומים שדורשים שפה מקומית שוטפת.

אותה משפחה

Llama-3.1-Nemotron-Nano יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו למוצר שפונה למשתמשים בישראל בעברית?

הכרטיס מציין רשמית תמיכה באנגלית, קוד ומספר שפות מערביות ואסיאתיות בלבד. עברית לא נבדקה ולא מוגדרת כשפה נתמכת, ולכן כדאי לבדוק אותו מקומית או לחפש מודל אחר אם עברית היא דרישת ליבה.

איך שולטים על זה שהוא לא יבזבז זמן על חשיבה מיותרת?

מעבירים בפרומפט המערכת מחרוזת ייעודית שמכבה את החשיבה, ועובדים בדגימה חמדנית. אם הוא עדיין מתעקש להוסיף מקטע מחשבה, צריך לשתול בתשובת העוזר תגית סגירה ריקה שתכריח אותו לגשת ישר לתשובה הסופית.

איך מריצים

המודל תופס 8.4 גיגה-בייט בקבצי המשקולות שלו בדיוק bfloat16. הוא נכנס בקלות לזיכרון של כרטיס RTX בודד מסדרות 30, 40 או 50, ואפשר להריץ אותו מקומית גם על חומרת Jetson ייעודית או מעבדי שרת כמו A100 ו־H100.

אנבידיה סיפקה תמיכה מסודרת להרצה דרך vLLM עם פרסר מובנה לקריאות כלים בפורמט JSON ותבנית צ'אט מותאמת. שרת כזה נותן נקודת קצה תואמת OpenAI בתוך דקות. אם אתם לא מחזיקים כרטיס מסך עם לפחות 12 עד 16 גיגה זיכרון כדי להחזיק גם את המודל וגם חלון הקשר סביר, עדיף להשתמש בשרת ענן במקום לחנוק את החומרה המקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3.1-Nemotron-Nano-4B-v1.1")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון המודלים הפתוחים של אנבידיה לצד תנאי הרישיון הקהילתי של Llama 3.1. המודל מוגדר כמוכן לשימוש מסחרי, כל עוד עומדים במגבלות של מטא ואנבידיה לגבי היקפי שימוש ותנאי הפצה.

הרישיון המלא בעמוד המודל ↗