GPT
M

Mistral-NeMo-Minitron-8B-Base

קוד פתוח

nvidiaother2024-08-19

  • transformers
  • nemo
  • safetensors
  • mistral
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל 12B שהוקטנה ל־8.4 מיליארד פרמטרים בעזרת זיקוק ידע וגיזום. הוא מתאים למי שרוצה בסיס קומפקטי יחסית לאימון המשך או התאמה אישית על חומרה צנועה יותר.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 31.4 GBמשקל הקבצים
  • 6,880הורדות בחודש

מה זה

אנשי אנבידיה לקחו את Mistral-NeMo המקורי בגודל 12B, קיצצו לו את ממדי השכבות וההטמעות, ואימנו אותו מחדש בתהליך זיקוק על 380 מיליארד טוקנים. הרעיון הוא לשמר חלק ניכר מהיכולת של מודל גדול יותר, אבל בגודל של כ־8.4 מיליארד פרמטרים שקל יותר לנהל.

במבחנים שמופיעים בדוח, הוא מגיע לציון של 69.5 ב־MMLU בחמש דוגמאות, ו־43.77 במבחן כתיבת הקוד MBPP. במתמטיקה עם GSM8K הוא עומד על 58.5 באפס דוגמאות. זה מציב אותו בטווח סביר לקטגוריה שלו, אבל מדובר במודל בסיס גולמי, כלומר הוא לא עבר התאמה לשיחה ולא מחזיר תשובות מלוטשות בלי הנחיה מדויקת או כוונון עדין נוסף.

מתאים ל

  • אימון מודל ייעודי לדומיין

    נקודת מוצא יעילה לכוונון עדין על מסמכים משפטיים או פיננסיים, במקום להתחיל מאפס.

  • השלמת קוד וטקסט פנימי

    השלמת משפטים ופונקציות ברמת התשתית בתוך מערכות סגורות שאינן דורשות ממשק צ'אט.

  • מחקר על דחיסת מודלים

    בדיקת ביצועים של מודלים שנוצרו בגיזום וזיקוק בהשוואה למודלים שאומנו רגיל באותו גודל.

איפה זה נופל

זהו מודל בסיס שלא עבר יישור סופי או סינון בטיחות קפדני. המפתחים מציינים במפורש שהנתונים כוללים טקסטים מהרשת שמכילים שפה פוגענית והטיות חברתיות, כך שהוא עלול לפלוט מידע שגוי, להשמיט עובדות או לייצר תוכן לא הולם גם בלי פרומפט בוטה. בנוסף, חלון ההקשר מוגבל בפועל סביב 8,000 תווים או טוקנים, ותאריך חיתוך המידע שלו הוא יוני 2023, כך שהוא לא מכיר אירועים מאוחרים יותר.

אותה משפחה

Mistral-NeMo-Minitron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כבוט שיחה?

לא מומלץ בכלל. זהו מודל בסיס שמיועד להשלמת טקסט, ולא עבר תהליך יישור שיחתי כמו מודלי Instruct. כדי לדבר איתו בצורה סבירה תצטרכו לאמן אותו קודם על דוגמאות שיחה או להשתמש בגרסה שעברה כוונון כזה.

האם הוא מבין עברית?

הנתונים שעליהם אומן כוללים שפות שונות מלבד אנגלית וקוד, אך אין בכרטיס המודל פירוט ספציפי או מבחני ביצועים בעברית. סביר להניח שהיכולת שלו בעברית בסיסית בלבד ודורשת בדיקה זהירה או אימון מקדים לפני שימוש רציני.

איך מריצים

כדי להריץ אותו במשקל המקורי ב־bfloat16, המשקלים שוקלים מעל 31 גיגה־בייט ב־14 קבצים. תצטרכו כרטיס מסך עם זיכרון וידאו של לפחות 24 גיגה־בייט, או שרת ייעודי כמו A100 שעליו נבדק המודל, במיוחד אם רוצים לעבוד עם מנועים מהירים כמו TensorRT-LLM או סביבת NeMo על לינוקס.

הקוד דורש התקנה ישירה של transformers מגיטהאב או גרסה עדכנית, והוא נתמך בארכיטקטורות אמפר, הופר, לובלייס ובלקוול. אם אין לכם חומרה כזו זמינה ורציפה במשרד או בענן, הרצה עצמית של מודל בסיס כזה תהיה יקרה ולא משתלמת בהשוואה לשימוש בשרתים מנוהלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Mistral-NeMo-Minitron-8B-Base")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון NVIDIA Open Model License Agreement. זהו אינו רישיון קוד פתוח סטנדרטי מסוג MIT או אפאצ'י, אלא הסכם קנייני של אנבידיה עם תנאים ומגבלות שימוש משלהם, ולכן חובה לקרוא את נוסח ההסכם המלא לפני שמשלבים אותו במוצר מסחרי שמופץ למשתמשי קצה.

הרישיון המלא בעמוד המודל ↗