GPT
L

Llama-3.1-Nemotron-70B-Instruct-HF

קוד פתוח

nvidiallama3.12024-10-12

  • transformers
  • safetensors
  • llama
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווננת של אנבידיה ללאמה 70B שמכוונת לתשובות מועילות ומפורטות במיוחד. היא עקפה מודלים סגורים במבחני התאמה להעדפות אדם.

  • 71Bפרמטרים
  • 131,072טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 10,888הורדות בחודש

מה זה

אנבידיה לקחה את Llama-3.1-70B-Instruct ואימנה אותו בשיטת RLHF על בסיס נתוני HelpSteer2 ומודל תגמול ייעודי. המטרה כאן הייתה להוציא תגובות מועילות ועשירות יותר לשאלות משתמשים כלליות, בלי להגדיל את כמות הפרמטרים.

במדדי השוואה אוטומטיים כמו Arena Hard ו־AlpacaEval 2 LC המודל עקף את מודל הבסיס של מטא בפער ניכר, ואף עבר מערכות כמו GPT-4o ו־Claude 3.5 Sonnet בגרסאות שנבדקו בתחילת אוקטובר 2024. הנתונים מראים שהתשובות שלו ארוכות משמעותית, עם ממוצע של כמעט 2,200 תווים ב־MT-Bench לעומת פחות מ־1,800 במודלים אחרים, מה שמסביר חלק מההעדפה של בוחנים אוטומטיים לתשובות מפורטות.

מתאים ל

  • עוזרי שיחה ומענה כללי

    מייצר תשובות מפורטות ומנומקות היטב בשאלות מורכבות באנגלית, ללא צורך בהנחיות מיוחדות.

  • סיכום ועיבוד מסמכים ארוכים

    תומך בקלט של עד 128k טוקנים, מה שמתאים לניתוח טקסטים ארוכים באנגלית.

  • יצירת דאטה סינתטי לאימון

    ציוני ההתאמה הגבוהים להעדפות אדם הופכים אותו לכלי יעיל לייצור דוגמאות טקסט איכותיות.

איפה זה נופל

הכרטיס מדגיש במפורש שהמודל לא כוונן לתחומים מקצועיים מוגדרים כמו מתמטיקה. הוא הותאם למענה על שאלות כלליות, ולכן הוא מייצר תשובות ארוכות במיוחד שעלולות לבזבז טוקנים וזמן תגובה במשימות קצרות. בנוסף, אף שהחלון קולט 128k טוקנים, הפלט מוגבל ל־4k טוקנים בלבד. שפת המודל המוצהרת היא אנגלית בלבד, וביצועיו בעברית לא נבדקו או אומנו באופן מכוון במחקר.

אותה משפחה

Llama-3.1-Nemotron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב פיתוח רגיל?

לא. משקל הקבצים הוא 131GB והוא דורש לפחות שני כרטיסי מסך מקצועיים של 80GB כדי לפעול. בשביל לבדוק אותו בלי שרת ייעודי עדיף להשתמש ב־API המקוון של אנבידיה.

איך הביצועים שלו במשימות קוד וחישובים?

אנבידיה מצהירה בפירוש שהמיקוד היה במענה כללי ומועיל, ולא נעשה כוונון ייעודי למתמטיקה או לתחומים טכניים צרים. למשימות לוגיות מורכבות עדיף לבדוק את התוצאות מול מודלים שהותאמו לקוד.

איך מריצים

בשביל להריץ אותו מקומית צריך לפחות שני כרטיסי מסך של 80GB כמו A100 או H100, ומינימום 150GB מקום פנוי בדיסק רק לקבצים השוקלים 131GB בפורמט bfloat16. הקוד נבדק על לינוקס בסביבת Transformers הרגילה, כך שכל תשתית שמריצה את לאמה 70B תדע לטעון גם אותו.

אם אין לכם שרת ייעודי כזה בענן, העלות השעתית לתחזוקת זוג כרטיסי 80GB כבדה מדי לניסויים קלים. במצב כזה עדיף לגשת ל־API של אנבידיה ב־build.nvidia.com שמציע ממשק תואם OpenAI להרצת שאילתות בלי לגעת בתשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama-3.1-Nemotron-70B-Instruct-HF")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הדגמים הפתוח של אנבידיה לצד תנאי הקהילה של Llama 3.1 של מטא. מותר להשתמש בו במוצרים מסחריים, אך יש לעמוד במגבלות השימוש והבטיחות שהוגדרו ברישיונות הללו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗