GPT
P

Phi-mini-MoE-instruct

קוד פתוח

microsoftmit2025-06-23

  • transformers
  • safetensors
  • phimoe
  • text-generation
  • conversational

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תערובת מומחים קטן שמפעיל רק 2.4 מיליארד פרמטרים בכל טוקן מתוך 7.6 מיליארד. הוא מספק ביצועים של מודל גדול בהרבה, אבל עם זמני תגובה מהירים במיוחד.

  • 7.6Bפרמטרים
  • 4,096טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 33,164הורדות בחודש

מה זה

מיקרוסופט דחסו את מודל הבסיס של Phi-3.5-MoE ו־GRIN-MoE באמצעות שיטה שנקראת SlimMoE, ואימנו אותו על 400 מיליארד טוקנים של מידע סינתטי וטקסטים מסוננים. הרעיון פה הוא ארכיטקטורת MoE, שבה מחזיקים 7.6 מיליארד פרמטרים בזיכרון, אבל מנתבים כל חישוב למומחים ספציפיים ומפעילים בפועל רק 2.4 מיליארד בכל שלב.

במבחני ביצועים הוא עוקף מודלים צפופים בגודל דומה. ב־MMLU הוא מגיע ל־70.68 נקודות, וב־Human-eval של קוד הוא רושם 73.80, שזה גבוה מ־LLaMA 3.1 8B שמפעיל את כל 8 המיליארד שלו בכל פעולה. הוא מקבל גם 84.89 במבחן המתמטיקה GSM8K, מה שמעיד על יכולת פתרון בעיות טובה יחסית לגודל הפעיל שלו.

מתאים ל

  • עוזרי שיחה מהירים באנגלית

    זמן תגובה קצר בזכות הפעלת 2.4 מיליארד פרמטרים בלבד בכל טוקן.

  • סיווג וחילוץ מידע קצר

    מתאים למשימות ממוקדות בטקסט קצר שלא חורג מחלון של 4,096 טוקנים.

  • פתרון בעיות קוד בסיסיות

    מציג 73.80 ב־Human-eval, בעיקר בסקריפטים של פייתון עם ספריות ליבה.

איפה זה נופל

חלון ההקשר קצר ועומד על 4,096 טוקנים בלבד, כך שהוא לא מתאים לניתוח מסמכים ארוכים או שיחות מתמשכות שבהן המודל נוטה ללכת לאיבוד. נקודת החיתוך של המידע היא אוקטובר 2023, והוא אומן בעיקר על אנגלית, כך שביצועים בעברית יהיו נמוכים משמעותית. הכרטיס מזהיר גם משיעור שגיאות גבוה בשאלות הקשורות לבחירות, ומציין שבקוד הוא מוגבל בעיקר לפייתון עם ספריות סטנדרטיות כמו typing ו־itertools.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל אומן בעיקר על אנגלית. הכרטיס מציין במפורש ששפות אחרות יחוו ביצועים נמוכים יותר, ולכן לא מומלץ להסתמך עליו בעיבוד שפה טבעית בעברית ללא כוונון נוסף.

למה להעדיף MoE על פני מודל רגיל של 7B?

במודל רגיל כל ה־7 מיליארד פרמטרים מחושבים בכל שלב. כאן המודל מחשב רק 2.4 מיליארד בכל פעם, מה שמאפשר מהירות הפקה גבוהה וצריכת כוח חישוב נמוכה יותר בזמן ריצה, תוך שמירה על ביצועים גבוהים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך שיכול להחזיק 14.2 גיגה-בייט של משקולות בדיוק bfloat16, ועוד מקום לזיכרון הריצה. היצרן בדק אותו על חומרות כמו A100, A6000 ו־H100, ומציין שהוא משתמש בברירת מחדל ב־Flash-Attention שמחייב ארכיטקטורת GPU מתאימה. כרטיס עם 24 גיגה זיכרון יספיק פה.

אם אין לכם כרטיס מסך ברמה הזו פנוי בשרת או בעמדה מקומית, עדיף להשתמש ב־API מנוהל. יש גם גרסה מוקטנת בסדרה, Phi-tiny-MoE, שמחזיקה 3.8 מיליארד פרמטרים ומפעילה רק 1.1 מיליארד, ומתאימה לחומרות צנועות בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-mini-MoE-instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, מה שנותן חופש כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗