GPT
F

Florence-2-large-ft

קוד פתוח

microsoftmit2024-06-15

  • transformers
  • pytorch
  • safetensors
  • florence2
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה קומפקטי שמבצע זיהוי עצמים, חילוץ טקסט ותיוג אזורי לפי פרומפטים מובנים. הוא נותן חלופה מקומית ומהירה לעבודה עם תמונות בלי להרים שרת ענק.

  • 770Mפרמטרים
  • 1,024טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 36,050הורדות בחודש

מה זה

מדובר במודל sequence-to-sequence לתמונות וטקסט שאומן על מאגר FLD-5B המכיל 5.4 מיליארד תיוגים בתוך 126 מיליון תמונות. הגרסה הזו עברה כוונון עדין על שורה של משימות במקביל, ומגיבה לפקודות טקסט ישירות כמו בקשה לקואורדינטות של אובייקט, קריאת טקסט בתוך תמונה או יצירת תיאור מפורט.

במדדי ההערכה הוא מציג מספרים מפתיעים ביחס למשקל שלו. בבדיקת TextVQA הוא מקבל דיוק של 73.5 בלי מנוע OCR חיצוני, ובמדד RefCOCO RES val הוא מגיע ל־80.5 mIoU, שזה מעל מודלים ייעודיים וכבדים בהרבה שנבחנו מולו.

מתאים ל

  • חילוץ טקסט ומיקום ממסמכים

    פרומפט ייעודי מחזיר גם את הטקסט וגם תיבות תוחמות מדויקות בלי תלות במנוע OCR נוסף.

  • זיהוי ומיקום עצמים לפי תיאור

    הוא ממפה ביטוי חופשי ישירות לקואורדינטות בתוך התמונה בדיוק גבוה של מעל 90 אחוז.

  • תיוג עשיר לאינדוקס תמונות

    יצירת תיאורים מפורטים ברמות שונות לקטלוג מאגרי מדיה מקומיים במהירות.

איפה זה נופל

בזיהוי עצמים כללי המודל מגיע ל־43.4 mAP בלבד על COCO Det val2017, בעוד מודלים ייעודיים באותו סדר גודל כמו UNINEXT מגיעים ל־60.6. חלון ההקשר מוגבל ל־1,024 טוקנים בלבד, כך שהוא לא בנוי לטקסטים ארוכים או שיחות מורכבות סביב תמונה. בנוסף, חובה להשתמש בפורמט הפרומפטים הקשיח שהוגדר לו, אחרת הפלט נשבר לחלוטין.

שאלות
נפוצות

האם המודל יודע לקרוא עברית מתמונות?

הכרטיס והאימונים מתמקדים באנגלית ובמבחנים בינלאומיים סטנדרטיים. אין תיעוד לתמיכה באותיות עבריות, ולכן סביר להניח שהביצועים ב־OCR על עברית יהיו נמוכים עד לא קיימים בלי אימון ייעודי.

מה ההבדל בין הגרסה הזו לגרסה הרגילה בלי הסיומת ft?

הגרסה הרגילה היא מודל בסיס כללי, בעוד גרסת ה־ft עברה כוונון על משימות ספציפיות כמו VQA וזיהוי מיושר טקסט. התוצאות שלה במשימות מוגדרות גבוהות משמעותית, ולרוב עדיף לבחור בה ליישום ישיר.

איך מריצים

המודל שוקל 2.9 גיגה-בייט ורץ בדיוק float16 דרך ספריית transformers. בזכות גודל של 770 מיליון פרמטרים אפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 6 או 8 גיגה זיכרון, ואין צורך באשכולות יקרים בענן.

אם אתם צריכים רק תיוג תמונה פשוט ומשקל עוד יותר נמוך, קיימת גם גרסת הבסיס עם 230 מיליון פרמטרים. פנייה ל־API חיצוני עדיפה רק אם העומס שלכם דורש סקייל פתאומי ואין לכם שרת זמין להחזיק דלוק ברקע.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Florence-2-large-ft")
print(pipe("שלום"))

הרישיון

רישיון MIT פתוח ומתיר שימוש מסחרי חופשי, שינוי קוד והפצה פנימית או חיצונית במוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של מיקרוסופט ותנאי הרישיון בתוך העותקים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗