GPT
P

Phi-4-mini-instruct

קוד פתוח

microsoftmit2025-02-19

  • transformers
  • safetensors
  • phi3
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל קומפקטי של 3.8 מיליארד פרמטרים שמציג יכולות היגיון ומתמטיקה חריגות לגודלו. מתאים למי שרוצה הרצה מקומית מהירה וזולה עם תמיכה בהקשר ארוך וקריאות לפונקציות.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.2 GBמשקל הקבצים
  • 461,049הורדות בחודש

מה זה

מיקרוסופט אימנה את הדגם הזה על חמישה טריליון טוקנים תוך סינון אגרסיבי של ידע כללי לטובת נתונים סינתטיים ממוקדי חשיבה, לוגיקה וקוד. התוצאה היא משקל נוצה שמנצח במבחני מתמטיקה כמו GSM8K עם ציון 88.6 ו־MATH עם 64.0, תוצאות שעוקפות אפילו מודלים כפולים ממנו בגודל דוגמת Llama 3.1 8B.

בניגוד לגרסאות קודמות בסדרה, כאן שילבו אוצר מילים מורחב של מעל 200 אלף טוקנים ותמיכה רשמית ברשימת שפות שכוללת גם עברית. עם זאת, במבחני שפה רב־לשוניים כלליים כמו Multilingual MMLU הוא עומד על 49.3 בלבד, כך שההתמקדות העיקרית שלו נשארה פתרון בעיות מובנות ולא ידע אנציקלופדי רחב.

מתאים ל

  • פתרון בעיות מתמטיקה וקוד

    מציג ציונים חזקים במיוחד במתמטיקה ולוגיקה ביחס לגודל קטן שרץ כמעט על כל שרת.

  • סוכן לפונקציות מקומיות

    כולל תבנית מובנית לקריאה לכלים ומאפשר בניית סוכנים מהירים על חומרה זולה.

  • מנוע עיבוד למערכות RAG

    חלון של 128 אלף טוקנים מאפשר להזין מסמכים ארוכים ולבצע עיבוד נתונים והיסק מדויק.

איפה זה נופל

הקיבולת הקטנה של המודל גורמת לו להזות עובדות בקלות, ובכרטיס המודל מודגש במפורש שידע כללי הוסר ממנו במכוון לטובת יכולות היגיון. ללא שילוב בסיס נתונים חיצוני בשיטת RAG, לא הייתי סומך עליו במתן מידע עובדתי. בנוסף, בקריאות לפונקציות הוא נוטה לפעמים להמציא שמות של כלים או כתובות רשת, ושיחות ארוכות עלולות לגרום לו לסטות מההקשר ולייצר טקסט חזרתי. בתכנות הוא הוכשר בעיקר בפייתון עם ספריות סטנדרטיות, כך שבשפות אחרות או חבילות נידחות חובה לבדוק כל קריאת קוד ידנית.

אותה משפחה

Phi-4-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

המודל מפרט את העברית ברשימת השפות הנתמכות, בין היתר בזכות אוצר מילים מורחב. עם זאת, האימון התמקד בעיקר באנגלית, ולכן ביצועי שפה ודיוק התחביר בעברית נמוכים יותר בהשוואה לאנגלית ודורשים בדיקה בפועל לפני הטמעה.

איך אפשר למנוע ממנו להמציא עובדות במוצר?

הדרך היחידה להשתמש בו באופן אמין למענה על שאלות היא הצמדה למקורות מידע דרך RAG. המודל תוכנן כך שאין לו מקום פנימי לזיכרון עובדתי נרחב, ולכן חובה להזין את המידע הרלוונטי ישירות לתוך הפרומפט.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.2 גיגה־בייט בדיוק bfloat16, מה שמאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 12 או 16 גיגה זיכרון, כמו כרטיסי RTX שכיחים. הוא נתמך ישירות בספריית transformers החל מגרסה 4.49.0 וכן במנוע vLLM להגשה בייצור עם דרישה ל־FlashAttention.

אם כל מה שאתם צריכים זה שאילתות בודדות או עיבוד מסמכים קצרים פעם ביום, זול ופשוט יותר להשתמש בנקודת קצה מנוהלת בענן של Azure שבה הוא זמין. שרת ייעודי מקומי שווה את ההשקעה רק כאשר עובדים ברצף מול נפח משתמשים קבוע או כשיש דרישה לזמני תגובה נמוכים במיוחד.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-4-mini-instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT, מה שנותן חופש פעולה כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗