GPT
P

Phi-3.5-vision-instruct

קוד פתוח

microsoftmit2024-08-16

  • transformers
  • safetensors
  • phi3_v
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה ושפה קומפקטי שמנתח רצפי תמונות ווידאו בלי לחנוק את הזיכרון של השרת. פתרון מתאים למי שחייב להריץ מולטימודל מקומית על חומרה צנועה יחסית.

  • 4.1Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.7 GBמשקל הקבצים
  • 624,111הורדות בחודש

מה זה

מדובר במודל שמשלב מעבד שפה מבוסס Phi-3 Mini יחד עם מקודד תמונה ומחבר ייעודי, ומיועד להבנה משולבת של טקסט ותמונות תחת חלון גדול במיוחד של 128 אלף טוקנים. הוא יודע לחבר מידע מכמה תמונות בו זמנית, להשוות ביניהן, לתמצת קטעי וידאו קצרים ולחלץ נתונים מגרפים ומסמכים.

בבדיקות מרובות תמונות כמו מדד בלנק, הוא מוציא ציון ממוצע של 57 נקודות, שזה מעל מתחרים בגודל דומה כמו אינטרן-וי-אל 4B ואפילו קרוב לקלוד 3.5 סונט. בתחום של ניתוח תרשימים בבנצ'מרק ChartQA הוא מקבל 81.8 נקודות ועוקף שירותי ענן גדולים בהרבה, אבל במשימות גיאומטריה ומתמטיקה חזותית מורכבת הוא עדיין נשאר מאחור עם ציונים נמוכים כמו 36.3 במדד InterGPS.

מתאים ל

  • ניתוח דוחות ותרשימים

    משיג ציון 81.8 במדד ChartQA ומחלץ נתונים מדויקים מגרפים וטבלאות סרוקות באנגלית.

  • השוואה בין תמונות מוצר

    יודע לעבד כמה תמונות ברצף בשיחה אחת ולזהות שינויים או הבדלים ויזואליים ביניהן.

  • תמצות קטעי וידאו קצרים

    מעבד רצפי פריימים של סרטונים עד 2 דקות ומפיק תיאור טקסטואלי של מה שקורה בהם.

איפה זה נופל

הכרטיס מדגיש שהאימון נעשה בעיקר באנגלית, כך שהביצועים בכל שפה אחרת, כולל עברית, יהיו נמוכים משמעותית ולא מומלץ להסתמך עליהם בלי בדיקה יסודית. כמו כן, בסיס הידע הטקסטואלי שלו נעצר במרץ 2024, ויכולות כתיבת הקוד שלו מתמקדות רק בספריות פייתון בסיסיות מאוד. אסור להשתמש בו לקבלת החלטות קריטיות בתחומי בריאות או משפט, ויש לו נטייה לייצר מידע שנראה אמין אך שגוי לחלוטין. במשימות מתמטיקה חזותית הוא מפגין חולשה ממשית.

שאלות
נפוצות

האם המודל מבין מסמכים בעברית?

החומר מציין שהאימון התמקד כולו באנגלית, ולכן ביצועים בשפות אחרות ירודים. הוא לא יטפל בעברית בצורה אמינה ללא התאמה ייעודית, ובמיוחד לא בטקסטים סרוקים.

כמה זיכרון GPU צריך כדי להריץ אותו?

המשקלים עצמם שוקלים 7.7 ג'יגה בייט בדיוק של bfloat16. להרצה שוטפת של עיבוד תמונות מרובות תצטרכו כרטיס עם לפחות 16 עד 24 ג'יגה בייט זיכרון גרפי, במיוחד אם תרצו לנצל את חלון ההקשר המלא.

איך המודל מתמודד עם זיהוי אנשים בתמונות?

באימון הבטיחות של המודל הוכנסו הגבלות שמונעות ממנו לזהות אנשים ספציפיים. מיקרוסופט אף ממליצה למפתחים לטשטש פנים לפני העלאת קבצים כדי לא להפר תקנות פרטיות.

איך מריצים

המודל נשען על ספריית transformers ודורש תלויות ספציפיות כמו PyTorch, torchvision וחבילת Flash-Attention. כדי לעבד תמונות ברזולוציה גבוהה כברירת מחדל עם Flash-Attention, תצטרכו כרטיסי מסך ארגוניים שנבדקו מולו כמו A100, H100 או A6000, אם כי אפשר לבטל את ההאצה הזו ולעבור למצב eager על כרטיסים נגישים יותר במחיר של מהירות.

מי שאין לו תשתית GPU מקומית מתאימה יכול להשתמש בו ישירות דרך Azure AI Studio. אם כל מה שאתם צריכים זה ניתוח של תמונה בודדת פעם בכמה דקות, עדיף לפנות לממשק מוכן כזה מאשר להחזיק שרת ייעודי שעולה כסף בכל שעה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Phi-3.5-vision-instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון MIT, אחד הרישיונות הכי מתירניים שיש בקוד פתוח. מותר לקחת אותו, לשלב אותו במוצרים מסחריים סגורים, לשנות את המשקלים או להריץ אותו כחלק ממוצר שנמכר ללקוחות, ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית, תוך הקפדה לא להפר את מדיניות הסימנים המסחריים של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗