GPT
L

Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct

קוד פתוח

nvidiacc-by-nc-4.02025-03-04

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מיוחדת של מודל שמונה מיליארד פרמטרים שמסוגלת לקרוא מעל ארבעה מיליון טוקנים ברצף. מי שצריך לנתח מאגרי קוד עצומים או ספרים שלמים מקבל כאן נפח עבודה חריג לגודל שלו.

  • 8Bפרמטרים
  • 4,292,608טוקנים בהקשר
  • 30.0 GBמשקל הקבצים
  • 598הורדות בחודש

מה זה

מדובר בהתאמה של אנבידיה לדגם הבסיס של מטא, שעברה אימון המשך ממוקד כדי למתוח את חלון ההקשר ממאה עשרים ושמונה אלף טוקנים לטווח של ארבעה מיליון. המודל שומר על היכולות הכלליות של שמונה מיליארד פרמטרים, אבל מיועד להתמודד עם כמויות טקסט שבדרך כלל דורשות חלוקה מורכבת למקטעים.

בדיקות הביצועים של אנבידיה מול מבחני הקשר ארוך כמו RULER ומבחן מחט בערימת שחת מראות שהשליפה נשמרת גם בעומק המיליונים. במקביל, במבחנים רגילים של קוד ומתמטיקה כמו HumanEval ו־GSM-8K הוא שומר על רמה דומה לדגם המקורי, בלי לאבד את היכולת לענות לפקודות פשוטות.

מתאים ל

  • ניתוח מאגרי קוד מלאים

    הזנה של פרויקטים שלמים כדי לאתר תלויות ותקלות ארכיטקטורה בלי לחתוך קבצים.

  • מחקר על ספריות מסמכים

    חיפוש עובדות והצלבת נתונים מתוך מאות מאמרים וספרים ארוכים באנגלית בבת אחת.

  • בדיקת אלגוריתמי הקשר

    סביבת בדיקה לפיתוח שיטות זיכרון ואחזור על מודל פתוח בעל חלון עצום.

איפה זה נופל

למרות ההקשר העצום, המוח מאחוריו נשאר מודל של שמונה מיליארד פרמטרים. ההבנה שלו, יכולת ההסקה הלוגית והיציבות בניסוח מוגבלות בהשוואה לדגמים ענקיים. בנוסף, המודל אומן על אנגלית בלבד, כך שעיבוד טקסטים בעברית בהיקף כזה צפוי להיתקל בבעיות דיוק, תרגום משובש ואיבוד פרטים.

אותה משפחה

Llama-3.1-Nemotron-8B-UltraLong יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב אישי כדי לקרוא ספרים שלמים?

אפשר לטעון אותו עם כרטיס מסך מודרני בעזרת קוונטיזציה לפקודות קצרות. ברגע שתזינו מאות אלפי טוקנים, דרישות הזיכרון לניהול ההקשר יחרגו מיכולת החומרה הביתית והמחשב ייעצר.

איך הוא מסתדר עם פקודות בעברית?

הנתונים מראים אימון על השפה האנגלית בלבד. הוא עשוי לפענח עברית בסיסית בגלל דגם המקור של מטא, אבל בניתוח טקסטים ארוכים בעברית הוא יתקשה מאוד ולא מומלץ להסתמך עליו.

איך מריצים

כדי להריץ אותו צריך פייתון עם ספריית transformers מגרסה 4.43.0 ומעלה, וטעינה דרך pipeline או AutoModel עם bfloat16. קבצי המשקלים שוקלים שלושים גיגה בפורמט המקורי, כך שכרטיס מסך ביתי בודד לא יספיק ברגע שמתחילים לדחוף טקסט ארוך באמת.

אפשר לטעון את המשקלים עצמם על כרטיס של עשרים וארבעה גיגה, אבל החזקת זיכרון עבור מיליוני טוקנים בפועל תדרוש שרת עם מספר מאיצים חזקים. אם אין לכם חומרת שרתים ייעודית, ניסיון לנצל את מלוא ההקשר באופן מקומי פשוט יקרוס מחוסר זיכרון, ועדיף להשתמש בתשתית ענן מנוהלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3.1-Nemotron-8B-UltraLong-4M-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, מה שאומר שאסור להשתמש במודל הזה בשום צורה מסחרית. הוא מיועד למחקר, ניסויים ולמידה בלבד. אם המטרה היא לשלב אותו במוצר שמכניס כסף או בשירות פנימי של חברה פעילה, הרישיון הזה חוסם אתכם לחלוטין.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗