GPT
F

Florence-2-base-ft

קוד פתוח

microsoftmit2024-06-15

  • transformers
  • pytorch
  • safetensors
  • florence2
  • image-text-to-text

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל ראייה זעיר של מיקרוסופט שעושה פענוח תמונה, זיהוי אובייקטים ו־OCR בלי לגעת במודלי ענק. הוא שוקל פחות מגיגהבייט ורץ כמעט על כל חומרה מקומית.

  • 232Mפרמטרים
  • 1,024טוקנים בהקשר
  • 887 MBמשקל הקבצים
  • 224,622הורדות בחודש

מה זה

מיקרוסופט אימנה פה ארכיטקטורת sequence-to-sequence על מאגר ענק של 5.4 מיליארד תיוגים, ואז כיווננה אותה ישירות למשימות קצה מוגדרות. במקום לחבר כמה כלים שונים, אחד לקריאת טקסט מתמונה, אחד למציאת עצמים ואחר לתיאור כללי, פונים אליו עם פרומפטים מובנים מראש כמו CAPTION או OCR ומקבלים ישירות טקסט או קואורדינטות של תיבות תוחמות.

התוצאות שלו מול הגודל מפתיעות. בציון קריאת כיתובים TextCaps הוא הגיע ל־143.9, שזה קרוב למודלים ייעודיים שגדולים ממנו פי עשרים ויותר. בזיהוי עצמים COCO הוא עומד על 41.4 mAP. זה אומר שהוא מתמודד יפה מאוד עם הבנה מרחבית, אבל עדיין נופל ממודלים ייעודיים כבדים שמתמחים רק בזיהוי עצמים ולא עושים שום דבר מעבר לזה.

מתאים ל

  • זיהוי ומיפוי טקסט במסמכים

    פרומפט ייעודי מחזיר גם את הטקסט וגם את הקואורדינטות שלו בתמונה במהירות גבוהה.

  • תיוג תמונות אוטומטי

    מייצר תיאורי תמונה קצרים או מפורטים לפי דרישה בלי צורך בתשתית שרתים יקרה.

  • איתור עצמים לפי שמות

    מאפשר לסמן תיבות סביב אובייקטים ישירות מתוך טקסט שמגדירים לו מראש.

איפה זה נופל

חלון ההקשר מוגבל ל־1,024 טוקנים, כך שהוא לא בנוי לקלוט טקסטים ארוכים או להחזיר תיאורים אינסופיים. הוא תלוי לחלוטין במבנה הפרומפטים הקשיח שהוגדר לו, ואם תנסו לדבר איתו בשפה חופשית כמו צ'אטבוט תקבלו תוצאות לא צפויות. ב־TextVQA הוא נעצר על 63.6 אחוז דיוק, כך שבפענוח שאלות מורכבות על שלטים ומסמכים הוא עדיין יפספס לא מעט, במיוחד כשהטקסט עמוס.

שאלות
נפוצות

האם המודל תומך בעברית?

האימון והבנצ'מרקים המדווחים התמקדו באנגלית בלבד. אם יש לכם צורך ב־OCR או הבנת תמונות בעברית, תצטרכו לבדוק אותו עצמאית על דוגמאות שלכם או לאמן אותו בהתאמה אישית.

מה ההבדל בין גרסת base-ft לגרסת base הרגילה?

גרסת base הרגילה היא מודל הבסיס שעבר רק אימון קדם על קובץ הנתונים הענק. גרסת ה־ft עברה כוונון עדין למשימות מוגדרות כמו זיהוי עצמים, OCR וכיתוב תמונות, ולכן היא מתאימה לשימוש מיידי בפיתוח.

איך מריצים

בגלל שמדובר ב־232 מיליון פרמטרים ששמורים בדיוק של float16, כל הקבצים שלו תופסים 887 מגהבייט בלבד. אפשר להריץ אותו ישירות דרך ספריית transformers על כרטיס מסך בסיסי לחלוטין עם 2 עד 4 גיגהבייט זיכרון, וגם על מעבד רגיל של מחשב נייד בלי להרגיש חנק.

אם אתם צריכים דיוק גבוה יותר במשימות שאלות ותשובות ויזואליות, יש גרסת large-ft עם 770 מיליון פרמטרים שמציגה שיפור ניכר ב־TextVQA. לשלוח קריאות ל־API חיצוני זה משהו ששווה לשקול רק אם המוצר שלכם צריך לנהל שיחה ארוכה ורב-שלבית על תמונה, תחום שהמודל הזה בכלל לא נבנה עבורו.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="microsoft/Florence-2-base-ft")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון MIT. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצר סגור ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים המקורית של מיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗