GPT
P

Phi-4-mini-flash-reasoning

קוד פתוח

microsoftmit2025-06-19

  • transformers
  • safetensors
  • phi4flash
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל של 3.9 מיליארד פרמטרים שזוקק מ־DeepSeek-R1 כדי לפתור בעיות מתמטיות קשות במהירות גבוהה, עם ארכיטקטורה היברידית שחוסכת משאבים ביצירת תשובות ארוכות.

  • 3.9Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.2 GBמשקל הקבצים
  • 1,500הורדות בחודש

מה זה

מיקרוסופט לקחה את מודל הבסיס שלה ואימנה אותו על נתונים סינתטיים של מתמטיקה בלבד, שנלקחו מ־DeepSeek-R1 וסוננו לפתרונות נכונים. המבנה הפנימי שלו משלב מנגנוני State Space Models יחד עם שכבת Differential Attention יחידה ושיתוף זיכרון בין שכבות. המטרה היא למנוע את הזינוק הריבועי בזמני העיבוד שמאפיין מודלי שפה רגילים כשמייצרים רצפים ארוכים.

במדדי מתמטיקה כמו Math500 הוא מגיע לציון של 92.45, ובמבחן AIME24 הוא עומד על 52.29. התוצאות האלה שמות אותו ברמה של מודלים גדולים ממנו בהרבה, כמו גרסאות 7B ו־8B של Qwen ו־Llama שזוקקו בצורה דומה. בבדיקות vLLM עם פלט של 32K טוקנים הוא מציג תפוקה גבוהה פי עשרה בהשוואה לגרסת ה־mini-reasoning הרגילה, תוך שמירה על זמני תגובה כמעט ליניאריים.

מתאים ל

  • פתרון בעיות מתמטיות

    חישוב שלבי לבעיות מורכבות במתמטיקה ואלגברה הדורשות לוגיקה מעמיקה בלי צורך במודל 70B.

  • הוכחות פורמליות וסימבוליות

    מעקב עקבי אחר שרשרת היסק ארוכה וחישובים סימבוליים בזכות זיקוק ישיר מ־DeepSeek-R1.

  • הסקה מהירה בסביבות מוגבלות

    הפקת טקסט ארוך של עד 32K טוקנים במהירות גבוהה על גבי GPU בודד בזכות ארכיטקטורת SSM היברידית.

איפה זה נופל

הוא מיועד למתמטיקה ולוגיקה בלבד. הוא לא מיועד לשיחה כללית, לא מחזיק ידע עולם רחב, ומייצר שגיאות עובדתיות מחוץ לתחום החישוב. מיקרוסופט מציינת במפורש ירידה בביצועים בכל שפה שאינה אנגלית, כך שאין מה לבנות עליו לעברית. בתכנות הוא הוגבל בעיקר לפייתון בסיסי, ובשיחות ארוכות הוא נוטה לחזרתיות. אסור להשתמש בו לייעוץ משפטי, רפואי או לנושאים שקשורים בבחירות.

שאלות
נפוצות

האם אפשר להשתמש בו בתור צ'אטבוט כללי באפליקציה?

לא. המודל אומן ונבדק על מתמטיקה בלבד. אין לו ידע עובדתי רחב, והוא עלול להמציא עובדות מחוץ לעולם החישוב וההיסק הלוגי.

איך הביצועים שלו בעברית?

הוא נתמך רשמית באנגלית בלבד. כל שפה אחרת תסבול מירידה משמעותית בדיוק ובאיכות הפלט, ולכן הוא לא מתאים לעיבוד שפה מקומית.

מה נדרש מבחינת חומרה ותוכנה כדי להרים אותו?

כרטיס מסך שמריץ Flash-Attention עם לפחות 16GB זיכרון, יחד עם התקנת ספריות ייעודיות כמו mamba-ssm ו־causal-conv1d בסביבת פייתון.

איך מריצים

כדי להריץ אותו מקומית נדרשים 7.2 גיגה־בייט של משקלים בפורמט bfloat16, מה שאומר שהוא נכנס בקלות לכרטיס מסך בודד של 16GB או 24GB. הבעיה היא התלויות. הקוד דורש ספריות ייעודיות כמו mamba-ssm, causal-conv1d ו־flash-attn, מה שמחייב סביבת לינוקס מתאימה ומגביל את הריצה לכרטיסי מסך שתומכים בהן. כרטיס המודל מציין בדיקות רשמיות על A100 ו־H100 בלבד.

אם אין לכם כוח להסתבך עם קומפילציה של הרחבות CUDA או שאין לכם חומרה מתאימה, הוא זמין לשימוש ישיר דרך ממשקי ענן ב־Azure וב־Nvidia NIM.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-4-mini-flash-reasoning")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא ומתירני. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר שלכם או למכור שירותים סביבו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗