GPT
N

Nemotron-4-340B-Instruct

קוד פתוח

nvidiaother2024-06-13

  • nemo

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ענק של 340 מיליארד פרמטרים שמיועד בעיקר לייצור נתוני אימון סינתטיים לאימון מודלים אחרים. הוא מציע אלטרנטיבה פתוחה למסחור עבור צוותים עם חוות שרתים עצומה.

  • 215 GBמשקל הקבצים
  • 212הורדות בחודש
  • 699לייקים

מה זה

מדובר במודל שיחה מכוונן באנגלית שעבר אימון מקדים על 9 טריליון טוקנים, אבל המטרה המרכזית שלו היא לא לענות בצ'אט למשתמשי קצה אלא לשמש מנוע שמייצר דאטה עבור מודלים קטנים יותר. אנווידיה ביצעה עליו כוונון עדין שהתבסס בכמעט תשעים ושמונה אחוזים על נתונים סינתטיים שנוצרו במערכת שלה, לצד שיטות יישור כמו DPO ושיטה פנימית בשם RPO.

במבחני ביצועים הוא מציג תוצאות טובות בחילוץ מידע עם ציון 9.20 ב־MT-Bench ומתמטיקה עם 92.3 ב־GSM8K, אבל הציונים שלו בתכנות ובהיגיון כללי נמוכים משמעותית. הוא קיבל 6.70 בלבד בקוד ו־6.40 בהיגיון באותו מבחן. גם ב־Arena Hard הוא עומד על 54.2, מה שמראה שבשיחה מורכבת מול בני אדם הוא עדיין רחוק מהרמה של המודלים המובילים בשוק.

מתאים ל

  • ייצור דאטה סינתטי

    יצירת אלפי דוגמאות אימון באיכות גבוהה באנגלית לצורך כוונון עדין של מודלים קטנים יותר.

  • חילוץ מידע מובנה

    שליפת נתונים מטקסטים קצרים בזכות ציון של 9.20 במבחני חילוץ מידע.

  • פתרון בעיות מתמטיות

    עיבוד משימות חישוב והסבר שלבי פתרון בדיוק גבוה לפי מבחן GSM8K.

איפה זה נופל

החיסרון הבולט הוא חלון הקשר המזערי שעומד על 4,096 טוקנים בלבד. אי אפשר להזין מסמכים ארוכים, קבצי קוד שלמים או לנהל שיחות מתמשכות. מעבר לזה, המודל מיועד ומיושר רק לאנגלית, והידע שלו נעצר ביוני 2023. אנווידיה מציינת בפירוש שהוא עלול לפלוט תוכן פוגעני, להטמיע הטיות חברתיות מהאינטרנט, לייצר תשובות לא מדויקות או להשמיט עובדות קריטיות.

אותה משפחה

Nemotron-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ליישומים בעברית?

הוא אומן על טקסטים בעשרות שפות אך עבר אופטימיזציה וכוונון ייעודיים לשיחה באנגלית בלבד. לא הייתי בונה עליו לייצור טקסט או דאטה בעברית.

למה חלון ההקשר מוגבל ל־4,096 טוקנים בלבד?

הארכיטקטורה אומנה מראש על אורך רצף זה. זהו צוואר בקבוק משמעותי לפרויקטים שדורשים קריאת מסמכים ארוכים או קוד מורכב.

האם כדאי להרים אותו עצמאית לצ'אט בוט פנימי?

ברוב המקרים לא. עלויות הברזלים של שישה עשר כרטיסי A100 או H100 גבוהות מאוד, ואיכות השיחה הכללית אינה מצדיקה החזקת שרת כזה עבור בוט.

איך מריצים

אי אפשר להריץ את הדבר הזה על שרת רגיל. בשביל להריץ הסקה ב־BF16 צריך שרת של שמונה כרטיסי H200, או שני שרתים שלמים שמכילים יחד שישה עשר כרטיסי H100 או A100 של 80 ג'יגה. המשקל לבדו תופס 215 ג'יגה בייט על הדיסק, ומדובר על עבודה עם קונטיינר NeMo של אנווידיה וניהול תהליכים דרך Slurm.

אם אין לכם אשכול מחשוב כזה בארגון, אין טעם לנסות להוריד אותו למחשב מקומי. הדרך היחידה להשתמש בו בלי תשתית של עשרות אלפי דולרים היא דרך ממשק ה־API של build.nvidia.com.

pip install -U huggingface_hub
hf download nvidia/Nemotron-4-340B-Instruct

הקבצים

983 קבצים במאגר, 215 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת NVIDIA Open Model License שמאפשר שימוש מסחרי חופשי, יצירה והפצה של מודלים נגזרים, ואנווידיה אינה טוענת לבעלות על הפלטים. אפשר להשתמש בו במוצרים מסחריים כל עוד עומדים בתנאי ההסכם של אנווידיה מיוני 2024.

הרישיון המלא בעמוד המודל ↗