GPT
G

GRIN-MoE

קוד פתוח

microsoftmit2024-09-10

  • transformers
  • safetensors
  • grinmoe
  • nlp
  • code

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תערובת מומחים של מיקרוסופט שרץ עם 6.6 מיליארד פרמטרים פעילים בלבד. הוא מיועד למי שרוצה ביצועי קוד ומתמטיקה חזקים מאוד בלי לשלם בזמן חישוב של מודל ענק.

  • 42Bפרמטרים
  • 4,096טוקנים בהקשר
  • 78.0 GBמשקל הקבצים
  • 564הורדות בחודש

מה זה

במקום להפעיל את כל 42 מיליארד הפרמטרים בכל מילה, הארכיטקטורה הזו מנתבת כל טוקן לשני מומחים בלבד מתוך 16, כך שבפועל רצים 6.6 מיליארד פרמטרים. האימון נעשה בשיטה שמעריכה גרדיאנטים ישירות לניתוב מומחים, בלי להפיל טוקנים בדרך.

במבחני ביצועים הוא עוקף מודלים גדולים ממנו בהרבה במשימות חשיבה. בחישובים מתמטיים של GSM-8K הוא הגיע לציון 90.4 ובכתיבת קוד בסיסי ביומנאיבל לציון 74.4, שניהם גבוהים ממה שמשיג מיקסטרל הגדול פי כמה. מצד שני, במבחני שפה כלליים וניתוח טקסט חופשי הוא מציג תוצאות בינוניות בהרבה.

מתאים ל

  • פתרון בעיות אלגוריתמיקה

    משיג ציון 90.4 במתמטיקה ומצטיין בחשיבה כמותית תחת תקציב חישוב של מודל קטן.

  • השלמת קוד בפייתון

    נשען על אימון ייעודי לתכנות ומספק מהירות תגובה של 6.6 מיליארד פרמטרים.

  • מחקר על ניתוב מומחים

    כולל מימוש פתוח מלא בגיטהאב של אימון יעיל בלי הפלת טוקנים.

איפה זה נופל

חלון ההקשר קצר מאוד, 4,096 טוקנים בלבד, מה שפוסל אותו לניתוח מסמכים ארוכים או קוד מורכב עם הרבה קבצים. בנוסף, הוא אומן באופן כמעט בלעדי על אנגלית, כך שבעברית הוא יפיק שגיאות, ניסוחים קלוקלים או פלט חסר ערך. נקודת תורפה נוספת היא תחום התכנות, שבו רוב האימון התמקד בפייתון עם ספריות סטנדרטיות, ולכן בקוד אחר הוא נוטה להזיות באישורי ממשקים ובשימוש בספריות חיצוניות.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב פיתוח רגיל?

לא. המשקלים שוקלים 78 גיגה בייט ומחייבים חומרת שרתים עם כרטיסי מסך תעשייתיים בעלי נפח זיכרון גבוה. בלי שרת כזה תיתקלו מיד בשגיאות חוסר זיכרון.

האם הוא מתאים לעיבוד טקסטים בעברית?

המודל מוגדר רשמית לאנגלית בלבד, ואינו כולל אימון משמעותי בשפות אחרות. ניסיונות לעבוד איתו בעברית יובילו לפלט באיכות נמוכה ולשיבושי תחביר קשים.

איך מריצים

כדי להעלות אותו לזיכרון בפורמט המקורי תצטרכו לפחות 80 גיגה בייט של זיכרון כרטיס מסך, כי המשקלים תופסים 78 גיגה בייט בקבצים. שרת עם כרטיס H100 בודד או שני כרטיסי A100 של 80 גיגה יספיק להרצה. מיקרוסופט מספקת סקריפט דוקר ישיר שמושך את המשקלים ומריץ מחברת ג׳ופיטר מקומית.

אם אתם לא מחזיקים תשתית כבדה כזו ורק רוצים לפתור בעיות נקודתיות של קוד, אין הגיון לשכור שרת ייעודי של עשרות אלפי שקלים בחודש. במקרה כזה עדיף לקרוא לפתרון מנוהל או למודל אחר דרך שירות ענן קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/GRIN-MoE")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, להטמיע אותו במוצר סגור או למכור שירותים שמבוססים עליו. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של מיקרוסופט בכל עותק, בלי אחריות מצד המפתחת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗