GPT
L

Llama-3.1-Nemotron-70B-Instruct

קוד פתוח

nvidiallama3.12024-10-12

  • nemo
  • nvidia
  • llama3.1
  • en

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווננת של לאמה 70B מבית אנבידיה שמציגה ביצועי שיחה גבוהים במיוחד. היא פונה למי שמחפש תשובות מפורטות ומדויקות להנחיות כלליות בלי להחזיק מודל ענק של מאות מיליארדי פרמטרים.

  • 44.7 GBמשקל הקבצים
  • 69הורדות בחודש
  • 569לייקים

מה זה

אנבידיה לקחה את בסיס ההוראות של לאמה 3.1 70B והעבירה אותו אימון חיזוק עם אלגוריתם REINFORCE, מודל תגמול ייעודי ומאגר הנתונים HelpSteer2 הכולל כעשרים אלף דוגמאות. המטרה היתה לחדד את המועילות והדיוק העובדתי של התשובות, והתוצאות במבחנים האוטומטיים אכן מיקמו אותו בראש טבלאות יישור המודלים באוקטובר 2024.

במדד Arena Hard הוא השיג 85.0 ובאלפקה אוואל 57.6, ציונים שעוקפים מודלים מובילים וסגורים. המשמעות בפועל היא יכולת גבוהה מאוד במעקב אחר הוראות מורכבות והבנת ניואנסים בשפה, אך רואים בבירור שהוא נוטה לייצר פלט ארוך ומפורט בהרבה מהרגיל, עם ממוצע של כמעט 2,200 תווים לתשובה במבחן MT-Bench.

מתאים ל

  • עוזר שיחה להנחיות מורכבות

    הוא מצטיין במענה מפורט ומדויק להוראות משתמש כלליות ומורכבות באנגלית בזכות ציוני ה־Arena הגבוהים.

  • יצירת תוכן מפורט באנגלית

    הנטייה שלו לייצר טקסטים ארוכים ועשירים בפרטים מתאימה למשימות ניסוח שדורשות העמקה.

  • בדיקת איכות ויישור מודלים

    יכול לשמש נקודת ייחוס מקומית לבחינת איכות המענה של מודלים אחרים על פי תקני HelpSteer2.

איפה זה נופל

המודל פותח אך ורק לשפה כללית ולמעקב אחרי הנחיות יומיומיות. אנבידיה מצהירה במפורש שהוא לא עבר כוונון למשימות מתמטיות או לתחומים מקצועיים מורכבים, כך שלא כדאי לבנות עליו לחישובים, לקוד סבוך או לחילוץ לוגי טהור. בנוסף, הנטייה שלו לתשובות ארוכות במיוחד עלולה להאט את זמני התגובה, לצרוך טוקנים רבים שלא לצורך, והוא מוגבל לטקסט באנגלית בלבד ללא התאמה לעברית.

אותה משפחה

Llama-3.1-Nemotron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב פיתוח רגיל?

לא. המודל דורש זיכרון וידאו עצום של לפחות שני כרטיסי 80GB או ארבעה כרטיסי 40GB מקצועיים של אנבידיה. למחשב מקומי סטנדרטי אין מספיק VRAM כדי לטעון אותו, ולכן עדיף להשתמש ב־API המנוהל של אנבידיה.

למה כדאי להוריד אותו במקום את לאמה 3.1 70B הרגיל?

אנבידיה שיפרה משמעותית את המועילות והדיוק של התשובות באמצעות אלגוריתם תגמול ייחודי. במבחני שיחה הוא עוקף את דגם המקור של מטא בפער גדול ומציג הבנה טובה יותר של כוונת המשתמש.

איך מריצים

כדי להריץ אותו עצמאית נדרשת מפלצת חומרה אמיתית. לפי היצרן צריך שרת לינוקס עם לפחות ארבעה כרטיסי 40GB או שני כרטיסי 80GB של אנבידיה בארכיטקטורות אמפר, הופר או טיורינג, לצד 150GB שטח דיסק פנוי לקבצים ולסביבת העבודה.

הריצה בגרסה הזו דורשת את חבילת NeMo, מנוע Triton, חשבון ומפתח ב־NGC ואישור גישה למשקלים של לאמה. למי שרוצה להימנע מההקמה הכבדה הזו יש גרסה מומרת לטרנספורמרס, או אפשרות לבדוק קריאות ישירות דרך נקודת הקצה שאנבידיה מארחת באתר שלה.

pip install -U huggingface_hub
hf download nvidia/Llama-3.1-Nemotron-70B-Instruct

הקבצים

986 קבצים במאגר, 44.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הדגמים הפתוח של אנבידיה לצד תנאי הקהילה של לאמה 3.1. הרישיון מתיר שימוש מסחרי ומחקר, אך מחייב עמידה במגבלות השימוש של מטא, כולל דרישה לאישור מיוחד לחברות עם למעלה מ־700 מיליון משתמשים פעילים חודשיים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗