GPT
M

Mistral-NeMo-Minitron-8B-Instruct

קוד פתוח

nvidiaother2024-10-02

  • transformers
  • nemo
  • safetensors
  • mistral
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת ומזוקקת של מודל 12B מבית אנבידיה שמיועדת למשימות קוד, הוראות והפעלת פונקציות. פתרון קל יותר להרצה מקומית בלי לאבד את יכולות הבסיס.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 31.4 GBמשקל הקבצים
  • 8,068הורדות בחודש

מה זה

אנבידיה לקחה את Mistral-NeMo המקורי בגודל 12 מיליארד פרמטרים, גזמה וזיקקה אותו לגודל של 8.4 מיליארד, ואז אימנה אותו בהתאמה להוראות בעזרת NeMo Aligner. המטרה כאן היא לתת ביצועים קרובים למקור אבל במעטפת שדורשת פחות זיכרון ומשאבי חישוב.

המבחנים מראים ציונים חזקים מאוד במתמטיקה עם 87.1 ב־GSM8K ובמעקב אחר הוראות עם 84.4 ב־IFEval. בקוד הוא מגיע לאזור ה־71 אחוז ב־HumanEval, וגם משימות חילוץ מידע והפעלת כלים נתמכות. לעומת זאת, מבחן GPQA מציג רק 31.5, מה שאומר שחשיבה מדעית מורכבת ועמוקה היא לא הצד החזק שלו.

מתאים ל

  • סוכן להפעלת פונקציות

    משיג ציון של 67.6 במבחן הכלים BFCL ומתאים לחיבור מול ממשקי תוכנה קיימים.

  • מענה מבוסס מסמכים

    תומך בחלון הקשר של 8,192 טוקנים ומאפשר שליפה מדויקת במערכות RAG ארגוניות.

  • עוזר פיתוח וכתיבת קוד

    רושם מעל 71 אחוז במבחני HumanEval ו־MBPP, מספיק ליצירת סקריפטים ופונקציות.

איפה זה נופל

המודל אומן על מידע גולמי מהרשת, ואנבידיה מזהירה במפורש שהוא עלול לייצר הטיות, שפה פוגענית או תשובות לא מדויקות שמשמיטות פרטים קריטיים. שימוש ללא תבנית הפרומפט המומלצת מחמיר את הבעיות האלה ומייצר תוכן עודף ולא רלוונטי.

בנוסף, אם אתם בונים סוכנים שמריצים קוד או קוראים לכלים חיצוניים, יש סכנה אמיתית של הזרקת פרומפטים ופגיעה באבטחה, ולכן חובה לוודא שכל חבילה שמיובאת מאומתת ממקור בטוח.

אותה משפחה

Mistral-NeMo-Minitron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי אחד?

במשקל המקורי ב־bfloat16 דרושים קרוב ל־18 גיגה זיכרון גרפי רק למשקלים, כך שדרוש כרטיס עם 24 גיגה כמו RTX 3090 או 4090. אם תבצעו המרה ל־4 ביט או 8 ביט, תוכלו להריץ אותו בקלות גם על כרטיסים צנועים יותר עם 12 או 16 גיגה.

למה התוצאות שאני מקבל מרגישות מקולקלות?

המודל תלוי באופן קריטי בתבנית הפרומפט הספציפית שעליה אומן, הכוללת את תגיות extra_id_0 ו־extra_id_1. שימוש בפרומפט רגיל או הזנחת תו הירידה בשורה בסוף ההוראה יפגעו קשות במבנה התשובה ובאיכות שלה.

איך מריצים

כדי להריץ אותו צריך לפרוק משקל קבצים של כ־31.4 גיגה בייט בפורמט bfloat16. זה אומר שבלי קוונטיזציה תצטרכו כרטיס עם לפחות 16 עד 24 גיגה בייט VRAM כדי לטעון אותו ולעבד טוקנים בנוחות יחד עם הקשר של עד 8,192 טוקנים.

ההרצה נעשית ישירות דרך ספריית transformers בפייתון. חובה להקפיד על תבנית הפרומפט המדויקת של אנבידיה עם התגיות הייעודיות extra_id כדי לא לפגוע באיכות הפלט. אם אין לכם חומרה ייעודית מתאימה, אפשר לבדוק אותו דרך ממשק ה־API ב־build.nvidia.com.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Mistral-NeMo-Minitron-8B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא NVIDIA Open Model License ולא קוד פתוח חופשי סטנדרטי כמו אפאצ'י או MIT. הרישיון מאפשר שימוש במודל אבל כפוף לתנאים ולהגבלות הספציפיים שהחברה מגדירה בהסכם שלה מיוני 2024. לפני שמשלבים אותו במוצר מסחרי, חובה לקרוא את מסמך תנאי השימוש של אנבידיה ולוודא שהתרחיש שלכם עומד בכל הדרישות והמגבלות שלהם.

הרישיון המלא בעמוד המודל ↗