GPT
P

Phi-4-multimodal-instruct

קוד פתוח

microsoftmit2025-02-24

  • transformers
  • safetensors
  • phi4mm
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

רשת נוירונים אחת של מיקרוסופט שמקבלת ישירות קול, תמונה וטקסט, בלי שרשור של מודלים נפרדים. היא נותנת ביצועי תמלול וראייה חזקים במיוחד ביחס למשקל של חמישה מיליארד פרמטרים.

  • 5.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 12.0 GBמשקל הקבצים
  • 240,531הורדות בחודש

מה זה

במקום לחבר מודל תמלול כמו Whisper למודל שפה נפרד, המודל הזה מעבד קול, תמונות וטקסט תחת אותה ארכיטקטורה בדיוק ומחזיר טקסט. המבנה הזה מאפשר לו לענות על שאלות מורכבות לגבי תמונות דרך קלט קולי ישיר, או לסכם הקלטות אודיו בלי לאבד ניואנסים ורעשי רקע שנמחקים בתמלול מוקדם.

בבדיקות השוואתיות של זיהוי דיבור הוא תפס את המקום הראשון בלוח המבחנים של Huggingface OpenASR עם שיעור שגיאות מילים של 6.14%, תוצאה שעוקפת את WhisperV3. במשימות ראייה הוא עומד בכבוד מול מודלים גדולים בהרבה. במבחן DocVQA להבנת מסמכים הוא קיבל 93.2, ובמבחן MathVista לחישובים מתוך תמונה הוא הגיע ל־62.4, תוצאות שמשאירות אבק למודלים פתוחים אחרים במשקל דומה.

מתאים ל

  • תמלול ותרגום אודיו ישיר

    עוקף את Whisper בבנצ'מרקים של ASR, ומסוגל לקבל קבצי שמע ולסכם אותם ישירות לטקסט.

  • חילוץ מידע ממסמכים וגרפים

    מציג ביצועים של 93.2 במבחן DocVQA, מה שהופך אותו לבחירה טובה לניתוח חשבוניות ותרשימים באנגלית.

  • הפעלת כלים וקריאות פונקציה

    עבר כוונון ייעודי לתמיכה בפורמט של Function Calling במערכות שדורשות ריצה מקומית ומהירה.

איפה זה נופל

הפיגור המרכזי של המודל מול ענקי הענן הוא שאלות ותשובות על בסיס קול. המפתחים מודים במפורש שיש פער מורגש בינו לבין Gemini 1.5 Flash ו־GPT-4o במענה מדובר ישיר. בנוסף, יכולות הראייה שלו אומנו באנגלית בלבד, וקלט השמע נתמך רק בשמונה שפות ספציפיות, ביניהן אנגלית, סינית וגרמנית. עברית נתמכת בטקסט בלבד, כך שלא תוכלו להזין לו קבצי קול בעברית או תמונות עם טקסט מקומי ולצפות לתוצאות טובות.

אותה משפחה

Phi-4-multimodal יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעיבוד קול ומסמכים בעברית?

המודל תומך בעברית כטקסט בלבד, לצד עוד כעשרים שפות. רכיב הראייה אומן באנגלית בלבד, ורכיב האודיו מוגבל לשמונה שפות שאינן כוללות עברית, כך שלא ניתן לתמלל איתו הקלטות מקומיות.

איזה כרטיס מסך מינימלי צריך כדי להריץ אותו?

המשקולות לבדן תופסות 12GB בזיכרון בפורמט bfloat16. להרצה בסיסית תצטרכו כרטיס עם 16GB VRAM, אך עבור קלטים ארוכים שמנצלים את חלון ההקשר תצטרכו 24GB VRAM ומעלה.

למה להעדיף אותו על פני שילוב של Whisper ומודל שפה?

הוא מבצע את כל הפעולות ברשת נוירונים בודדת. המבנה הזה חוסך השהיה של העברת נתונים בין שתי מערכות, מונע אובדן הקשר של רעשי רקע וטון דיבור, ומאפשר לשאול שאלות קוליות ישירות על תמונות.

איך מריצים

כדי להריץ אותו מקומית צריך סביבת Python 3.10, ספריית transformers מגרסה 4.48.2 ומעלה, ורצוי מאוד להתקין את flash-attn. המודל שוקל 12 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 16GB זיכרון כדי להעלות אותו, ויותר מזה אם בכוונתכם לנצל את חלון ההקשר העצום שלו. אם אתם מכוונים למכשירים אישיים, קיימת גרסת ONNX רשמית שמתאימה יותר למערכות קצה.

אם אין לכם כרטיס תואם בענן או במחשב הפיתוח, אין היגיון להסתבך עם קונפיגורציית הדרייברים של עיבוד קול ותמונה מקומי. במקרה כזה עדיף לגשת ישירות לנקודות הקצה המוכנות ב־Azure AI Studio או ב־GitHub Models.

from transformers import pipeline

pipe = pipeline("automatic-speech-recognition", model="microsoft/Phi-4-multimodal-instruct")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מופצים תחת רישיון MIT. מותר להשתמש במודל לכל מטרה, כולל מוצרים מסחריים וסגורים, לשנות אותו ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקבצי המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗