GPT
P

Phi-4-reasoning

קוד פתוח

microsoftmit2025-04-09

  • transformers
  • safetensors
  • phi3
  • text-generation
  • phi

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

זהו מודל חשיבה קומפקטי שמייצר שרשרת מחשבה לפני התשובה. הוא מיועד למי שצריך יכולות ניתוח מתמטי וקוד מקומיות בלי להחזיק שרת כבד.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.3 GBמשקל הקבצים
  • 27,720הורדות בחודש

מה זה

מדובר במודל צפוף של כמעט 15 מיליארד פרמטרים, שעבר אימון ייעודי על נתוני שרשרת חשיבה ולמידת חיזוק. הפלט שלו מורכב משני חלקים קבועים: בלוק שמציג את שלבי החשיבה המלאים, ולאחריו בלוק סיכום עם התשובה הסופית למשתמש.

במבחני ביצועים הוא עוקף מודלים פתוחים גדולים ממנו בהרבה, כמו גרסת הזיקוק של DeepSeek-R1 בנפח 70B, במיוחד במתמטיקה אולימפית כמו AIME 24 שבה קיבל ציון 75.3 לעומת 69.3. הוא גם מציג קפיצה ברורה ביחס לגרסת הבסיס הקודמת של Phi-4 במעקב אחר הוראות מדויקות, אך נשאר ממוקד בעיקר בלוגיקה ובמדעים מדויקים.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא מציג ציונים של 75.3 ב־AIME 24 ומפרק תרגילים מורכבים לשלבי ביניים ברורים.

  • סקריפטים ואלגוריתמיקה

    הוא יעיל לכתיבת אלגוריתמים בפייתון ולפתרון בעיות חישוביות בסביבה מבוקרת.

  • הסבר תהליכי הסקה

    מבנה הפלט מחזיר תיעוד מלא של תהליך החשיבה לפני התשובה הסופית.

איפה זה נופל

המודל אומן ונבדק כמעט אך ורק באנגלית, ואינו מיועד לתמיכה רב לשונית. עבודה בעברית תניב ביצועים ירודים ולא אמינים. בנוסף, הכרטיס מצהיר על שיעור שגיאות גבוה במיוחד בשאלות שקשורות לבחירות, ועל נטייה להזיות ומידע מיושן שהאימון שלו נחתם במרץ 2025.

בתחום התכנות, רוב הנתונים התמקדו בפייתון ובספריות הבסיס שלו. אם תבקשו ממנו קוד בשפות אחרות או חבילות מורכבות יותר, יש צורך בבדיקה ידנית של ה־APIs שהוא מייצר כי הוא נוטה לייצר שגיאות שם.

שאלות
נפוצות

האם אפשר להשתמש בו לעיבוד טקסטים בעברית?

לא מומלץ. המודל אומן באופן מובהק על אנגלית והיוצרים מצהירים במפורש שאינו מיועד לשימוש רב לשוני. כל ניסיון להריץ אותו על שפות אחרות יוביל לירידה מורגשת בדיוק ובאיכות החשיבה.

איזה כרטיס מסך נדרש כדי להריץ אותו מקומית?

במשקל המקורי של 27.3 גיגה בייט צריך כרטיס עם זיכרון של 40 גיגה בייט לפחות. כדי להריץ אותו על כרטיס ביתי פופולרי של 16 או 24 גיגה בייט, תצטרכו להשתמש בגרסאות מכומתות דרך Ollama או llama.cpp.

איך מריצים

המשקל הגולמי של הקבצים עומד על 27.3 גיגה בייט בדיוק bfloat16. כדי לטעון אותו במלואו לצד זיכרון הקשר רחב צריך כרטיס מקצועי עם לפחות 40 עד 48 גיגה בייט VRAM, או לחלופין לפנות לכימות דרך llama.cpp או Ollama כדי לדחוס אותו לכרטיס צרכני בודד.

ההרצה דורשת שימוש בתבנית ChatML והגדרות דגימה ספציפיות של טמפרטורה 0.8 ופרמטרים מוגדרים היטב של top_k ו־top_p. בסביבות שרת אפשר להריץ אותו דרך vLLM עם פרסר ייעודי לשרשראות חשיבה, אך אם אין לכם חומרה ייעודית מתאימה, ניהול שרתי ענן בשבילו עלול להיות יקר ביחס לקריאות שירות מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-4-reasoning")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT מלא ופתוח. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותו כחלק ממוצר סגור או להטמיע אותו בשרתים פרטיים. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים המקורית של מיקרוסופט לצד הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗