GPT
P

Phi-4-reasoning-plus

קוד פתוח

microsoftmit2025-04-17

  • transformers
  • safetensors
  • phi3
  • text-generation
  • phi

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסת חשיבה מעמיקה של מיקרוסופט למודל 15B, שמתחרה ישירות במודלים ענקיים במתמטיקה ומדע. היא פונה למי שצריך יכולת היסק חריפה במיוחד בתקציב חומרה מקומי.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 27.3 GBמשקל הקבצים
  • 10,816הורדות בחודש

מה זה

מיקרוסופט לקחה את הבסיס של Phi-4 ואימנה אותו בשיטות SFT וחיזוק עם דגש כבד על שרשראות חשיבה. התוצאה מייצרת בלוק חשיבה מפורט לפני שהיא פולטת את התשובה הסופית. מדובר בשיפור ישיר על פני גרסת ה־reasoning הרגילה, שמעלה את רמת הדיוק אבל מייצרת בממוצע 50% יותר טוקנים, מה שמאט את קצב התגובה בפועל.

במדדי מתמטיקה כמו AIME 2024 המודל מגיע ל־81.3, וב־AIME 2025 ל־78.0. המספרים האלה מציבים אותו מעל מודלים פתוחים כבדים בהרבה כמו DeepSeek-R1-Distill-70B ומשתווים למערכות מסחריות כמו o3-mini. בתחום הקוד התמונה מתונה יותר, עם ציון של 53.1 ב־LiveCodeBench, נתון סביר שמעיד על עבודה טובה באלגוריתמיקה אבל פחות בהנדסת תוכנה רחבה.

מתאים ל

  • פתרון בעיות מתמטיות

    מגיע ל־81.9 ב־OmniMath ומפרק הוכחות מורכבות שלב אחר שלב באמצעות שרשרת חשיבה ייעודית.

  • סימולציות אלגוריתמיות

    מתמודד היטב עם תכנון וחישובי 3SAT או בעיית הסוכן הנוסע בלי תלות במודלים חיצוניים ענקיים.

  • מנוע היסק מקומי ומאובטח

    מתאים לסביבות מנותקות רשת שחייבות יכולות דמויות DeepSeek-R1 בגודל שניתן להרצה מקומית.

איפה זה נופל

הכרטיס מדגיש בפירוש שהמודל נבנה ונבדק בעיקר עבור מתמטיקה ומדע באנגלית בלבד. בעברית או בכל שפה אחרת הביצועים יורדים מיד, ואין כאן תמיכה רב־לשונית מובנית. החיסרון המרכזי בעבודה שוטפת הוא זמני השהיה, שכן תוספת של 50% בכמות הטוקנים מייקרת ומאיטה כל שאילתה. בקוד, האימון התמקד בעיקר בפייתון עם ספריות סטנדרטיות, כך שבשפות תכנות אחרות או בספריות מורכבות יש סכנת הזיות גבוהה. בנוסף, מפתחי המודל מדווחים על שיעור שגיאות גבוה במיוחד בשאלות שנוגעות לבחירות.

שאלות
נפוצות

האם אפשר לשלב אותו במוצר שמשרת משתמשים בעברית?

לא מומלץ. המודל אומן ונבדק באנגלית בלבד, ומיקרוסופט מציינת במפורש ששפות אחרות מציגות ירידה חדה באיכות. אם אתם חייבים עברית, עדיף להשתמש במודל רב־לשוני ייעודי או לתרגם את השאילתה לאנגלית לפני שליחתה למודל.

מה ההבדל המעשי בינו לבין Phi-4-reasoning הרגיל?

גרסת הפלוס עברה אימון נוסף בלמידת חיזוק, מה שמקפיץ את הדיוק במתמטיקה מ־62.9 ל־78.0 ב־AIME 2025. המחיר של השיפור הזה הוא תוספת של כ־50% יותר טוקנים של חשיבה לכל תשובה, מה שמגדיל את זמן ההמתנה ואת ניצול המשאבים.

איך מריצים

המשקל הגולמי של הקבצים עומד על 27.3GB בדיוק של bfloat16. כדי לטעון אותו כמו שהוא צריך כרטיס מקצועי עם לפחות 32GB עד 48GB של VRAM, כמו A6000 או צמד כרטיסים צרכניים. אם מכווצים אותו בקוונטיזציה דרך Ollama או llama.cpp אפשר לדחוף אותו לכרטיס 16GB או 24GB בודד, שם הוא רץ בלי בעיה.

מיקרוסופט דורשת להגדיר בבקרת הדגימה טמפרטורה של 0.8, וממליצה על ChatML יחד עם פרסר ייעודי כמו deepseek_r1 ב־vLLM כדי להפריד את שלב ההיסק מהתשובה. אם אין לכם שרת ייעודי שפועל מסביב לשעון, זול יותר לפנות ל־API חיצוני מאשר להחזיק חומרה דלוקה רק בשביל תהליכי חשיבה ארוכים.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-4-reasoning-plus")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא ופתוח. מותר להשתמש בו במוצרים מסחריים, לשנות את המשקלים, לארח אותו בתשלום ולהפיץ אותו ללא תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית של מיקרוסופט בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗