GPT
P

Phi-4-reasoning-vision-15B

קוד פתוח

microsoftmit2026-01-23

  • safetensors
  • phi4-siglip
  • multimodal
  • vision-language
  • reasoning

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המודל מחבר יכולות ראייה להסקה לוגית ב־15 מיליארד פרמטרים. הוא מיועד למי שצריך לפענח ממשקים, דיאגרמות ותרשימים בלי לשלוח מידע החוצה.

  • 15Bפרמטרים
  • 32,768טוקנים בהקשר
  • 28.2 GBמשקל הקבצים
  • 6,613הורדות בחודש

מה זה

מייקרוסופט חיברו כאן את מודל השפה Phi-4-Reasoning למקודד הראייה SigLIP-2 בארכיטקטורת מיזוג אמצעי. החלק הוויזואלי מייצר עד 3,600 טוקנים לתמונה ברזולוציה דינמית, מה שעוזר לו לזהות פרטים קטנים במסמכים ובמסכים. המערכת יודעת לעבוד בשני מצבים באותו מודל, חשיבה מורכבת וארוכה בתוך תגיות ייעודיות לפתרון בעיות מתמטיות, או מענה ישיר ומהיר לזיהוי אובייקטים וחילוץ טקסט.

במבחני ביצועים הוא מציג תמונה מעורבת מול המתחרים בקטגוריה. בבדיקות של איתור אלמנטים בממשקי משתמש כמו ScreenSpot-V2 הוא מקבל 88.2, תוצאה חזקה שמקדימה מודלים מקבילים של גוגל. מנגד, במבחני מתמטיקה מורכבת מול תמונות כמו MathVision הוא מגיע ל־36.2 בלבד, ובחילוץ טקסט ב־OCRBench הוא עומד על 76, הרחק מאחורי סדרת Qwen3-VL שמגיעה לאזור ה־90.

מתאים ל

  • סוכני אוטומציה לממשקים

    זיהוי ומיקום אלמנטים אינטראקטיביים בצילומי מסך של דסקטופ ואתרים.

  • ניתוח תרשימים וגרפים באנגלית

    חילוץ נתונים והסקת מסקנות לוגיות מתוך דיאגרמות ותרשימים טכניים.

  • פתרון בעיות מדעיות מודפסות

    הפעלת שרשרת חשיבה מובנית לצורך פיענוח נוסחאות ואיורים מתמטיים.

איפה זה נופל

המודל אומן בעיקר על אנגלית. אין לו תמיכה רשמית בריבוי שפות, ובשפות אחרות, כולל עברית, הביצועים יורדים באופן משמעותי. לא הייתי משתמש בו לשום יישום שדורש פיענוח טקסט מקומי או מסמכים בעברית.

הוא מועד להזיות במשימות ויזואליות, עם שיעור פגמים מדווח של 4.5 אחוזים בעיבוד תמונה לטקסט. בנוסף, חילוץ הטקסט והמתמטיקה התחרותית שלו חלשים מרוב המתחרים הישירים בשוק. החברה מצהירה מפורשות שהוא אינו מתאים לייעוץ רפואי, משפטי או פיננסי.

שאלות
נפוצות

איך מכריחים את המודל לחשוב או לענות מהר בלי חשיבה?

שולטים בזה דרך תבנית השיחה. אם מוסיפים את הטוקן think בסוף ההנחיה, המודל מפעיל שרשרת חשיבה מפורטת. הוספת הטוקן nothink מדלגת על השלב הזה ומחזירה תשובה ישירה ומהירה למשימות פשוטות.

האם המודל יצליח לקרוא צילומי מסך או מסמכים בעברית?

הכרטיס מציין שהאימון התמקד באנגלית בלבד ואינו מיועד לתמיכה רב־לשונית. שפות אחרות סובלות מירידה חדה באיכות, ולכן למסמכים בעברית עדיף לבחור מודל עם תמיכה מוכחת בשפה.

איך מריצים

המשקל הכולל של הקבצים עומד על 28.2 גיגה־בייט. כדי להריץ אותו בפורמט bf16 תצטרכו כרטיס מסך עם לפחות 48 גיגה זיכרון גרפי, דוגמת A6000, או כרטיסי שרת ייעודיים כמו A100 ו־H100 שעליהם הוא נבדק. מבחינת תוכנה, נדרשת תמיכה בגרסאות עדכניות של torch מגרסה 2.7.1, transformers מגרסה 4.57.1, ושרת vLLM מגרסה 0.15.2 ומעלה.

אם יש לכם כרטיס בודד חלש יותר, אין טעם לנסות להריץ אותו מקומית בהגדרות המלאות. במקרה כזה עדיף לצרוך אותו כשירות מנוהל דרך Azure AI Foundry, או לבחור מודל קטן יותר שרץ על חומרה ביתית.

pip install -U huggingface_hub
hf download microsoft/Phi-4-reasoning-vision-15B

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בקוד סגור ולהפיץ אותו בתוך מוצר בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים ונוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗