GPT
F

Florence-2-base

קוד פתוח

microsoftmit2024-06-15

  • transformers
  • pytorch
  • safetensors
  • florence2
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה קטן שמבצע זיהוי עצמים, חילוץ טקסט ותיאור תמונות לפי הוראות טקסט פשוטות. הוא שוקל פחות מג'יגהבייט ורץ בקלות על מחשב מקומי.

  • 232Mפרמטרים
  • 1,024טוקנים בהקשר
  • 887 MBמשקל הקבצים
  • 2,800,149הורדות בחודש

מה זה

מיקרוסופט אימנה את הדגם הזה על מאגר FLD-5B שמכיל 5.4 מיליארד תיוגים בתוך 126 מיליון תמונות. במקום להחזיק רשת נפרדת לחילוץ טקסט ורשת נפרדת לתיחום עצמים, הוא מקבל תמונה יחד עם תגית משימה קבועה כמו OCR או OD, ומחזיר ישירות טקסט או קואורדינטות של תיבות.

במדדי Zero-shot על תיאור תמונות הוא הוציא ציון CIDEr של 133.0 בבדיקות COCO מול מודלים עצומים כמו Flamingo של 80 מיליארד פרמטרים שקיבל 84.3 בלבד. מצד שני, בזיהוי עצמים הוא השיג ציון mAP של 34.7, כך שהוא לא יחליף מודלים ייעודיים שמתמחים רק בזה, אבל הוא נותן נקודת פתיחה טובה למגוון משימות במקביל.

מתאים ל

  • חילוץ טקסט עם מיקום

    זיהוי תווים בתמונה יחד עם קואורדינטות מדויקות של תיבות הטקסט.

  • קטלוג ותיוג תמונות

    הפקת תיאורים קצרים או מפורטים לסידור מאגרי מדיה גדולים.

  • איתור עצמים לפי טקסט

    קבלת ביטוי בטקסט וסימון המיקום של העצם המתאים בתוך התמונה.

איפה זה נופל

הקלט הטקסטואלי מוגבל לחלון של 1,024 טוקנים, והוא נשען על תבניות פרומפטים קשיחות מראש ולא על שיחה טבעית. בדיוק הזיהוי שלו, ציון של 34.7 במדד COCO, הוא מפספס עצמים מורכבים בהשוואה למודלים ייעודיים. אין בכרטיס המודל נתונים על תמיכה בעברית, כך שלא הייתי בונה עליו לחילוץ טקסט בעברית בלי בדיקה מוקדמת.

שאלות
נפוצות

איך מבקשים ממנו לבצע משימה שונה?

המודל מגיב למחרוזות מוגדרות מראש שמעבירים לו כקלט. במקום לכתוב הנחיה חופשית, שולחים תגיות שמורות כמו OCR, OD או DETAILED_CAPTION יחד עם התמונה.

האם כדאי לבחור בגרסה הזו או בגרסת ה־ft?

גרסת ה־ft עברה התאמה למשימות קצה ומגיעה לציונים גבוהים יותר, למשל 41.4 במדד COCO לעומת 34.7 בבסיסית. אם אתם צריכים ביצועים מוכנים בלי לאמן בעצמכם, עדיף לקחת את גרסת ה־ft.

איך מריצים

המשקל הכולל של הקבצים הוא 887 מגהבייט בדיוק של float16, כך שאין צורך בשרתים ייעודיים או כרטיסי מסך תעשייתיים. כל כרטיס גרפי ביתי פשוט עם שניים עד ארבעה ג'יגהבייט זיכרון יריץ אותו דרך ספריית transformers בלי בעיה, ואפשר להריץ אותו גם על מעבד רגיל.

הגרסה הזו היא הבסיס ללא התאמה ייעודית, כשיש גם גרסת large עם 770 מיליון פרמטרים וגרסאות שעברו fine-tuning למשימות ספציפיות. שווה לפנות ל־API חיצוני רק אם אתם צריכים שיחה חופשית ארוכה על התמונה או תיאורים מורכבים מאוד, כי למשימות חילוץ ממוקדות המודל הזה קל ומהיר מספיק להרצה עצמית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Florence-2-base")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. מותר להשתמש בו במוצרים מסחריים, לשנות את המשקלים ולהפיץ אותם מחדש, בתנאי שמשאירים את הודעת זכויות היוצרים המקורית של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗