GPT
F

Florence-2-large

קוד פתוח

microsoftmit2024-06-15

  • transformers
  • pytorch
  • safetensors
  • florence2
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה קומפקטי שמפענח תמונות ומחזיר טקסט וקואורדינטות לפי פקודות פשוטות. הוא מתאים למי שחייב OCR, זיהוי אובייקטים ותיוג תמונות מקומית בלי לגעת במודלים כבדים.

  • 777Mפרמטרים
  • 4,096טוקנים בהקשר
  • 2.9 GBמשקל הקבצים
  • 617,661הורדות בחודש

מה זה

מדובר במודל רב-משימתי מסוג sequence-to-sequence שמקבל תמונה והוראה טקסטואלית קצרה, ומפיק תיאור, קופסאות תוחמות או טקסט שמופיע בפריים. האימון המקורי שלו התבסס על מאגר הנתונים FLD-5B של מיקרוסופט, שמכיל מיליארדי תוויות, מה שמאפשר לו לעבור בין משימות שונות לחלוטין רק על ידי החלפת מילת הפקודה. הגרסה הזו היא דגם בסיס שאומן מחדש כדי לתמוך בחלון הקשר של 4,096 טוקנים ובעיבוד שורות חדשות במשימות קריאת טקסט.

בבדיקות השוואה מול מודלים עצומים כמו Flamingo שכולל 80 מיליארד פרמטרים, המודל השיג ציון CIDEr של 135.6 מול 84.3 בתיאור תמונות ללא אימון ייעודי. המשמעות בפועל היא יכולת תיאור חדה ומדויקת יותר של סצנות מורכבות, אף על פי שהוא שוקל רק שבריר מהם. במשימות קישור בין טקסט למיקום בתמונה הוא מגיע לדיוקים של מעל 84 אחוזים בבדיקות דוגמת Flickr30k, אבל מציג ביצועים בינוניים יחסית בזיהוי אובייקטים כללי.

מתאים ל

  • חילוץ טקסט עם מיקום

    קריאת שלטים, תפריטים או מסמכים והחזרת הטקסט יחד עם קואורדינטות מדויקות של תיבות הטקסט בתמונה.

  • תיוג תמונות אוטומטי

    יצירת תיאורים קצרים או מפורטים לקטלוגים ומאגרי תמונות גדולים ישירות על השרת המקומי.

  • איתור אלמנטים לפי תיאור

    איתור קופסאות תוחמות של אובייקטים ספציפיים בסצנה על בסיס משפט חופשי שמגדיר מה מחפשים.

איפה זה נופל

הכרטיס עצמו מדגיש שההרחבה לחלון הקשר של 4k נשענה על מאגר של 100 מיליון דוגמאות בלבד, ולכן קיים סיכוי ממשי שהוא לא אומן מספיק טוב למצבי קצה. נוסף לכך, במשימות זיהוי עצמים בסיסיות הוא רושם ציון mAP של 37.5 בלבד, שנופל משמעותית ממודלים ייעודיים. זה לא כלי שמתאים לבקרת איכות תעשייתית קריטית או לאיתור פרטים זעירים בלי לבצע לו קודם התאמה ממוקדת על המידע שלכם.

שאלות
נפוצות

האם המודל תומך בעברית למשימות OCR?

החומר הטכני והמאגרים שעליהם אומן מתמקדים באנגלית, כך שלא כדאי לבנות עליו לפענוח עברית מהקופסה. תצטרכו לאמן אותו מחדש על דאטה מקומי אם זו המטרה שלכם.

למה להשתמש בגרסה הזו ולא בגרסת ה־ft?

גרסת הבסיס מתאימה בעיקר כנקודת מוצא לאימון על נתונים פרטיים שלכם, או למשימות מגוונות שמשלבות איתור וטקסט יחד. אם אתם צריכים ביצועים מקסימליים מיידיים במשימה ספציפית, גרסאות ה־ft מציגות ציונים גבוהים יותר.

איך מריצים

המודל שוקל פחות משלושה גיגה-בייט ורץ בדיוק float16 דרך ספריית transformers הרגילה של פייתון. אפשר להריץ אותו בנוחות על כרטיס מסך ביתי בסיסי עם 6 עד 8 גיגה זיכרון, ואין שום צורך בחומרת שרתים יקרה או באשכולות מעבדים גרפיים כדי לקבל זמני תגובה מהירים.

יש למודל גרסת base קטנה עוד יותר וגרסאות שעברו fine-tuning למשימות קצה, שמשיגות תוצאות טובות בהרבה. אם המטרה שלכם היא משימה מוגדרת כמו זיהוי ויזואלי של שאלות ותשובות, עדיף לקחת ישירות את גרסת ה־ft. כדאי לפנות ל־API חיצוני רק אם המוצר שלכם צריך לנהל שיחה חופשית ואינטליגנטית סביב התמונה, ולא רק לחלץ מידע מובנה ומדיד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Florence-2-large")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד, לשלב אותו במוצרים סגורים ולהפיץ אותו ללקוחות, בתנאי ששומרים על הצהרת זכויות היוצרים של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗