GPT
L

Llama-3_1-Nemotron-51B-Instruct

קוד פתוח

nvidiaother2024-09-22

  • transformers
  • safetensors
  • nemotron-nas
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל הדגל מבית מטא שתוכננה לשבת על כרטיס H100 בודד. הוא נותן ביצועים קרובים למקור של שבעים מיליארד פרמטרים בחצי מעלות השרתים.

  • 52Bפרמטרים
  • 131,072טוקנים בהקשר
  • 95.9 GBמשקל הקבצים
  • 711הורדות בחודש

מה זה

אנשי אנבידיה לקחו את לאמה 3.1 המקורי בן 70 מיליארד הפרמטרים וחתכו אותו באמצעות אלגוריתם שחיפש ארכיטקטורה יעילה יותר. במקום מבנה אחיד, הם שינו את מספר הראשים בכל שכבה, דילגו על מנגנון הקשב בחלק מהמקומות ושינו את יחסי השכבות הפנימיות. התוצאה היא מודל של 51 מיליארד פרמטרים שעבר זיכוך ידע על 40 מיליארד טוקנים כדי להחזיר את היכולות שאבדו בצמצום.

במדדי ההיגיון והידע הוא עומד יפה מול המקור. הוא קיבל 80.2 אחוז במבחן הידע הרב תחומי MMLU ותוצאה של 91.43 אחוז בפתרון בעיות חשבון בית ספר, מה שמראה שהחיתוך הארכיטקטוני לא פגע ביכולות המתמטיות שלו. עם זאת, במבחן האמינות וההזיות TruthfulQA הוא עומד על 58.63 אחוז בלבד, כך שלא מדובר במודל שמחסל הזיות.

מתאים ל

  • בוט שיחה באנגלית בענן

    מתאים לשרת H100 יחיד ב־FP8 כדי לחתוך עלויות תשתית בחצי בלי לאבד מאיכות השיחה של שבעים מיליארד.

  • כתיבת קוד ובדיקות תוכנה

    מציג יכולות מתמטיקה ולוגיקה חזקות עם מעל 91 אחוז בדיוק, מה שמספק בסיס טוב להשלמת קוד.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר ענק של 131,072 טוקנים לקריאת תיעוד טכני נרחב בפעימה אחת.

איפה זה נופל

המודל פגיע מאוד למתקפות ששוברות עכבות ואבטחה. אנבידיה מודה במפורש בכרטיס המודל שהוא חלש מול ניסיונות פריצה ודורש שכבת הגנה חיצונית כמו guardrails לפני שחושפים אותו למשתמשי קצה. בנוסף, הוא עלול לייצר טקסט פוגעני או לחזור על הטיות כי הוא אומן על מידע רשת פתוח, והוא מועד להזיות כפי שמעיד הציון הנמוך יחסית במדד TruthfulQA. נתוני האימון שלו נחתכו אי שם ב־2023, והוא מיועד בעיקר לאנגלית וקוד, כך שאין מה לבנות עליו לעברית יציבה.

שאלות
נפוצות

האם הוא יעבוד לי על כרטיס RTX ביתי?

לא. משקל הקבצים לבדו מגיע כמעט ל־96 גיגה, כך שאפילו עם כרטיס כמו RTX 4090 של 24 גיגה לא תצליחו לטעון אותו לזיכרון. המודל דורש חומרת שרתים מקצועית של שמונים גיגה ומעלה.

איך הביצועים שלו בעברית?

המודל אומן ועבר זיכוך בעיקר לאנגלית וקוד, עם חומרי אימון כמו FineWeb ו־Dolma. למרות שתאורטית יש לו תמיכה בסיסית בשפות נוספות, הכרטיס אינו מתחייב ליכולת בעברית ולכן עדיף לא להסתמך עליו למשימות שפה מקומיות.

איך מריצים

כדי להריץ אותו בדיוק המקורי של bfloat16 תצטרכו שני כרטיסי A100 או שני H100 עם 80 גיגה זיכרון. הקבצים שוקלים כמעט 96 גיגה, כך שכרטיס בודד פשוט ייחנק מיד. השימוש האמיתי בו מיועד לקוונטיזציה של FP8, ושם הוא נכנס בדיוק לתוך כרטיס H100 יחיד של 80 גיגה ומאפשר תעבורה גבוהה בלי לחלק שכבות בין שרתים.

אתם צריכים סביבת לינוקס, גרסת transformers מ־4.44.2 ומעלה והגדרה מפורשת של trust_remote_code כי הארכיטקטורה שלו מבוססת DeciLM ולא סטנדרטית. אם אין לכם גישה לכרטיסי שרת של שמונים גיגה לפחות, אין לכם מה לנסות להוריד אותו מקומית, עדיף להשתמש ב־API של שירות ענן כמו NIM של אנבידיה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3_1-Nemotron-51B-Instruct")
print(pipe("שלום"))

הקבצים

43 קבצים במאגר, 95.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הדגמים הפתוח של אנבידיה יחד עם תנאי הקהילה של לאמה 3.1. מותר להשתמש בו מסחרית במוצרים שלכם, אך הרישיון דורש לעמוד במגבלות השימוש המקובלות של שתי החברות, ואינו רישיון קוד פתוח חופשי לחלוטין מסוג MIT או אפאצ'י.

הרישיון המלא בעמוד המודל ↗