GPT
P

Phi-tiny-MoE-instruct

קוד פתוח

microsoftmit2025-06-23

  • transformers
  • safetensors
  • phimoe
  • text-generation
  • conversational

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל שיחה דחוס מבית מיקרוסופט שרץ במהירות של מודל קטן עם דיוק של מודל גדול יותר. מתאים למי שחייב להריץ מקומית עם מעט זיכרון ורוצה זמן תגובה מהיר.

  • 3.8Bפרמטרים
  • 4,096טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 144,923הורדות בחודש

מה זה

המודל מבוסס על ארכיטקטורת תערובת מומחים עם 3.8 מיליארד פרמטרים בסך הכול, אבל רק 1.1 מיליארד מהם מופעלים בכל טוקן. המשמעות היא חישוב קל בהרבה ומהירות הפקה גבוהה, בזמן שגודל המודל הכולל בזיכרון נשאר סביב 3.8 מיליארד פרמטרים. הבסיס שלו נדחס וזוקק מ־Phi-3.5-MoE ו־GRIN-MoE, ולאחר מכן עבר אימון מעקב אחר הוראות ובטיחות על גבי נתונים סינתטיים וטקסטים מסוננים.

במבחני ביצועים רואים היטב את הפשרות. בבדיקות ידע כללי והיגיון כמו MMLU עם ציון 60.83 ו־BBH עם 45.58, הוא משאיר מאחור מודלים קטנים רגילים כמו LLaMA 3.2 1B שקיבל 46.30 ו־35.18 בהתאמה, ואף עוקף את Gemma 3 4B ב־MMLU. עם זאת, הוא חלש יותר ממודלים צפופים של 7 או 8 מיליארד פרמטרים, ונשאר פתרון ביניים שמיועד לפעולות מוגבלות משאבים.

מתאים ל

  • עוזרי שיחה בסביבת קצה

    זמן התגובה מהיר בזכות 1.1 מיליארד פרמטרים פעילים בלבד, מה שמתאים לחומרה מוגבלת.

  • פתרון בעיות מתמטיקה בסיסיות

    המודל השיג ציון של 78.47 במבחן GSM8K, תוצאה חזקה יחסית למודל בגודל הזה.

  • סיווג ותמצות טקסטים קצרים באנגלית

    הוא מטפל ביעילות במשימות הוראה מוגדרות שלא חורגות ממגבלת 4,096 הטוקנים.

איפה זה נופל

חלון ההקשר מוגבל מאוד ועומד על 4,096 טוקנים בלבד, מה שמונע עיבוד מסמכים ארוכים או שיחות מורכבות. המודל אומן בעיקר על אנגלית, ולכן ביצועיו בשפות אחרות כמו עברית יהיו חלשים משמעותית. הוא גם סובל מנטייה להזיות, חוזר על עצמו בשיחות ארוכות, והאימון שלו בקוד התמקד בעיקר בפייתון עם ספריות סטנדרטיות ספציפיות. בנוסף, המידע שלו מעודכן עד אוקטובר 2023 בלבד ויש לו שיעור שגיאות גבוה בנושאי בחירות.

שאלות
נפוצות

האם המודל מבין ומייצר עברית כמו שצריך?

לא כדאי להסתמך עליו בעברית. מיקרוסופט מציינת במפורש שהאימון התמקד באנגלית ושפות אחרות יסבלו מביצועים ירודים. לשימוש בעברית תצטרכו לבצע כוונון עדין בעצמכם או לבחור מודל רב לשוני אחר.

כמה זיכרון דרוש בפועל כדי להריץ אותו?

המשקלים עצמם שוקלים 7.0 ג'יגה בייט. לצורך הרצה תקינה ב־bfloat16 עם זיכרון הקשר תצטרכו כרטיס מסך עם לפחות 10 עד 12 ג'יגה בייט VRAM. שימוש בקוונטיזציה עשוי להוריד את הדרישה הזו עוד יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.0 ג'יגה בייט בפורמט bfloat16. כדי לטעון אותו תצטרכו כרטיס מסך עם לפחות 10 עד 12 ג'יגה בייט של VRAM שיספיקו למודל, לזיכרון הריצה של ההקשר ולשכבות הקשב. מיקרוסופט מציינת תמיכה ב־Flash-Attention ובדקה אותו על חומרות כמו A100, A6000 ו־H100.

אם כל מה שאתם צריכים זה מענה פשוט באנגלית בלי דרישות אבטחה מחמירות של שמירת מידע בתוך השרת, קריאה ל־API של מודל גדול ומנוהל תעלה לכם גרושים ותחסוך תחזוקת GPU. הריצה המקומית שווה את ההשקעה רק כשאתם חייבים זמני תגובה קצרים במיוחד בקצה או סביבה מנותקת רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-tiny-MoE-instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי, תוך הקפדה שלא להשתמש בסימנים המסחריים של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗