GPT
P

pix2struct-base

קוד פתוח

googleapache-2.02023-03-13

  • transformers
  • pytorch
  • safetensors
  • pix2struct
  • image-text-to-text

מודל ראייה ושפה קומפקטי של גוגל שלמד להבין צילומי מסך דרך המרתם ל־HTML פשוט. הוא מיועד לכוונון עדין למשימות כמו מענה על שאלות מתמונות ותיאור ממשקים.

  • 282Mפרמטרים
  • 2.1 GBמשקל הקבצים
  • 20,369הורדות בחודש
  • 80לייקים

מה זה

מדובר בארכיטקטורת מקודד תמונה ומפענח טקסט עם 282 מיליון פרמטרים בלבד. במקום לחבר מנוע OCR נפרד למודל שפה, הוא מקבל את התמונה ישירות ומעבד אותה ברזולוציה משתנה, כשההנחיות הטקסטואליות מרונדרות ישירות על גבי התמונה עצמה.

אימון הבסיס שלו התמקד בלקיחת צילומי מסך מהרשת עם חלקים מוסתרים ותרגומם למבנה ה־HTML של הדף. התהליך הזה הכריח אותו ללמוד במקביל קריאת טקסט, הבנת מבנה של אתרים וממשקים, וזיהוי תמונות, מה שמאפשר לו לשמש נקודת מוצא חזקה למגוון משימות ויזואליות באנגלית, צרפתית, רומנית וגרמנית.

מתאים ל

  • אימון להבנת ממשקי משתמש

    בסיס מצוין לכוונון עדין על צילומי מסך של אפליקציות ואתרי אינטרנט כדי לחלץ כפתורים וטפסים.

  • מענה על שאלות ממסמכים

    מתאים לאימון על דיאגרמות ותרשימים שדורשים קריאת נתונים ויזואליים יחד עם טקסט.

  • יצירת תיאורים לתמונות

    מבנה המקודד והמפענח הקל מאפשר לאמן אותו לייצור כתוביות ותיאורים ברזולוציות שונות.

איפה זה נופל

הכרטיס מדגיש במפורש שהגרסה הזו מיועדת אך ורק לכוונון עדין. אם תנסו להריץ עליה פרומפטים ישירות, תקבלו פלט לא שימושי כי המודל לא אומן לייצר תשובות ישירות למשתמש.

בנוסף, המודל אומן בעיקר על אנגלית, צרפתית, רומנית וגרמנית, כך שאין כאן תמיכה בעברית מובנית. מי שבונה מוצר מקומי יצטרך לאסוף דאטה מתאים ולאמן אותו בעצמו מאפס על טקסט וממשקים בעברית.

שאלות
נפוצות

אפשר להשתמש במודל הזה ישירות כדי לקרוא קבלות או מסמכים?

לא. מדובר במשקלי בסיס שנועדו אך ורק לכוונון עדין. כדי לבצע משימה כזו בפועל צריך לקחת את המשקלים האלה ולאמן אותם על דאטה ייעודי של קבלות או לחפש גרסה שכבר עברה אימון כזה.

האם המודל תומך בזיהוי טקסט וממשקים בעברית?

השפות המדווחות כוללות אנגלית, צרפתית, רומנית וגרמנית, ועברית אינה ברשימה. סביר מאוד שהוא יתקשה בזיהוי תווים בעברית ללא אימון נוסף עם דוגמאות מתאימות.

איך מריצים

המשקל הכולל של הקבצים הוא 2.1 גיגה בייט בדיוק float32, כך שכל כרטיס מסך בסיסי או שרת ענן פשוט עם כמה גיגה בייטים של זיכרון יריץ אותו בלי בעיה דרך ספריית transformers.

המשקלים האלה הם נקודת פתיחה לאימון ולא מוצר מוגמר לפרודקשן. אם אתם צריכים פתרון שעובד ישר מהקופסה בלי להשקיע זמן וכוח מחשוב בכוונון עדין, חפשו משקלים שכבר אומנו למשימה ספציפית או פנו ל־API ייעודי.

from transformers import pipeline

pipe = pipeline("image-to-text", model="google/pix2struct-base")
print(pipe("שלום"))

הרישיון

רישיון apache 2.0 מאפשר שימוש חופשי, כולל מסחרי, שינוי הקוד והפצה של המודל כחלק ממוצר שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗