GPT
M

Minitron-4B-Base

קוד פתוח

nvidiaother2024-07-19

  • transformers
  • pytorch
  • nemo
  • nemotron
  • text-generation

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של נמיטרון שנוצרה מגיזום וזיכוך של מודל ענק. היא נותנת ביצועים של מודלים גדולים בהרבה באריזה קלה שרצה על חומרה מקומית.

  • 4,096טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 3,477הורדות בחודש
  • 138לייקים

מה זה

המודל הזה נולד מתוך Nemotron-4 15B, אבל במקום לאמן אותו מאפס, אנבידיה חתכו שכבות, ראשי קשב וממדים פנימיים, ואז העבירו אותו זיכוך עם 94 מיליארד טוקנים. השיטה הזו חסכה המון כוח חישוב באימון והשאירה מודל של 4 מיליארד פרמטרים שמציג תוצאות מפתיעות. לפי הנתונים שלהם, הוא מתחרה ישירות במודלים כבדים ממנו כמו Mistral 7B או Llama-3 8B.

במבחנים הקלאסיים הוא מוציא 58.6 ב־MMLU ו־75.0 ב־HellaSwag. זה אומר הבנה שפתית כללית סבירה מאוד לגודל שלו, אבל כשמגיעים למשימות מורכבות יותר רואים את הפשרות. ב־GSM8K הוא מקבל רק 24.1, ובמבחן כתיבת הקוד HumanEval הוא עומד על 23.3 בלבד. במילים פשוטות, הוא קורא ומבין טקסט ברמה טובה, אבל לא בנוי לחשיבה מתמטית עמוקה או לכתיבת תוכנה מורכבת.

מתאים ל

  • סיווג וחילוץ מידע

    מתאים לעיבוד מהיר ומקומי של טקסטים קצרים באנגלית תודות למבנה הקומפקטי.

  • השלמת טקסטים באנגלית

    מתפקד מצוין כמודל בסיס להמשך כתיבה ויצירת טיוטות ראשוניות ברמת שפה טובה.

  • בסיס לאימון מותאם

    משמש נקודת מוצא זולה לכוונון עדין למשימות מוגדרות מראש שאינן דורשות קוד.

איפה זה נופל

זה מודל בסיס ולא מודל שעבר התאמה לשיחה, מה שאומר שהוא ממשיך טקסט ולא בהכרח עונה ישירות לשאלות. נקודת התורפה הבולטת היא יכולת החישוב והקוד, עם ציונים נמוכים מאוד של 24.1 במתמטיקה ו־23.3 בקוד. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, כך שאי אפשר להזין אליו מסמכים ארוכים. המידע שלו נעצר ביוני 2023, והכרטיס מציין במפורש שהוא עלול לפלוט הטיות, תוכן פוגעני ותשובות שגויות מתוך נתוני האינטרנט שעליהם אומן. הוא גם מוגדר באנגלית, כך שאין מה לבנות עליו לעברית.

אותה משפחה

Minitron יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה יכול לשמש כצ'אטבוט מוכן לשימוש?

לא. מדובר במודל בסיס שמיועד להשלמת טקסט, ולא במודל שעבר כוונון להוראות או לשיחה. כדי להשתמש בו לצ'אט תצטרכו להעביר אותו כוונון עדין עם דאטה של שיחות.

האם אפשר לעבוד איתו בעברית?

לא מומלץ בכלל. המודל מוגדר רשמית לאנגלית בלבד, וגם אם הוא יזהה אותיות בעברית, הביצועים שלו יהיו גרועים ומקוטעים בהשוואה לחלופות.

מה היתרון שלו מול מודלים פופולריים כמו Llama 3 8B?

היתרון המרכזי הוא הגודל הפיזי וכוח החישוב הדרוש. הוא שוקל חצי ממודל של 8 מיליארד פרמטרים, מה שמאפשר להריץ אותו על חומרה זולה יותר תוך שמירה על ביצועי שפה דומים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־15.6 ג'יגה בייט בפורמט bfloat16, כך שצריך כרטיס מסך עם לפחות 16 ג'יגה זיכרון כדי להריץ אותו בלי קוונטיזציה. אנבידיה בדקו אותו על A100 עם מנוע TensorRT-LLM, אבל אפשר להעלות אותו ישירות דרך ספריית transformers של פייתון על כרטיסים צרכניים חזקים. שימו לב שבגלל הארכיטקטורה הייעודית, נדרשת התקנה ישירה של transformers מהמאגר בגיטהאב.

אם אתם צריכים רק מדי פעם לעבד טקסטים קצרים באנגלית ואין לכם כרטיס מתאים זמין, עדיף להשתמש במודל גדול יותר דרך שירות ענן. המודל הזה שווה את המאמץ רק אם יש לכם צורך מובהק בריצה מקומית, בעלויות תשתית נמוכות ובזמני תגובה מהירים למשימות טקסט שגרתיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Minitron-4B-Base")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא הרישיון הפתוח של אנבידיה, NVIDIA Open Model License Agreement. הכרטיס מדגיש במפורש שהמודל מיועד למחקר ופיתוח בלבד. המשמעות ברורה, אי אפשר לשלב אותו כמו שהוא בתוך מוצר מסחרי פעיל או להפיץ אותו ללקוחות בלי לבדוק לעומק את תנאי ההסכם המשפטי של אנבידיה.

הרישיון המלא בעמוד המודל ↗