GPT
B

blip3-ocr-200m

קוד פתוח

Salesforceapache-2.02024-09-04

  • dataset
  • ocr
  • multimodal
  • vision
  • image-text-to-text

מאגר שמספק תגיות טקסט ומיקומי OCR מפורטים עבור כ־2 מיליון תמונות ממקור DataComp. הוא פותר את הקושי של מודלי ראייה שפה בהבנת מסמכים, תרשימים ותמונות עמוסות טקסט.

  • 2,301הורדות בחודש
  • 45לייקים

מה זה

המאגר מכיל כ־2 מיליון רשומות המחולקות על פני עשרות קובצי Parquet. הנתונים מתבססים על תמונות ממאגר DataComp, שעברו חילוץ טקסט באמצעות מנוע PaddleOCR. כל רשומה מחזיקה מזהה ייחודי, קישור מקור לתמונה אם הוא קיים, קואורדינטות של פנים שזוהו, ותיאורי OCR ברמות פירוט משתנות.

הייחוד במבנה הוא חלוקה ל־12 דרגות פירוט של תיוג. שש הדרגות הראשונות נעות מחילוץ טקסט גולמי בסיסי, דרך מיקום כללי ומיקום יחסי, ועד לקואורדינטות מדויקות ותיבות חוסמות סביב המילים. שש הדרגות הבאות משלבות את אותן רמות פירוט טקסטואליות יחד עם הכיתוב המקורי שנלקח מ־DataComp, מה שמאפשר לבחון אימון עם ורמות שונות של הקשר חזותי.

מתאים ל

  • אימון מקדים של מודלי ראייה

    חיזוק יכולות ההבנה של מודלים מול תמונות עמוסות טקסט, מסמכים וגרפים באמצעות צימוד טקסט מקומי.

  • ניתוח מסמכים ותרשימים

    פיתוח מערכות שמסוגלות לאתר מילים במרחב התמונה ולחבר בין נתונים חזותיים למיקומים מדויקים.

  • מחקר על רמות תיוג ב־OCR

    בדיקת ההשפעה של רמות פירוט שונות, ממיקום כללי ועד תיבות מדויקות, על איכות הביצועים של המודל.

איפה זה נופל

הטקסטים במאגר הם באנגלית בלבד, ואין כאן תמיכה בעברית או באותיות מימין לשמאל. מכיוון שהטקסט חולץ כולו בעזרת כלי אוטומטי, PaddleOCR, שגיאות זיהוי של המנוע זלגו ישירות לתוך הנתונים ולא עברו סינון אנושי. בנוסף, המאגר כולל בעיקר קישורים לתמונות שמקורן ברשת ולא קבצים מקומיים, מה שאומר שחלק ניכר מהתמונות המקוריות עלול לא להיות זמין להורדה בגלל קישורים שבורים. כדאי לבדוק היטב את תקינות הקישורים ואיכות הטקסט המחולץ לפני שמתחילים להסתמך עליו בבניית מוצר.

שאלות
נפוצות

האם המאגר כולל טקסטים בעברית?

המאגר מוגדר לשפה האנגלית בלבד. כל הטקסטים שחולצו על ידי מנוע ה־OCR והכיתובים המקוריים הם באנגלית, ואין בו ייצוג לשפות שנכתבות מימין לשמאל.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון המוצהר הוא אמנם apache-2.0, אך המפרסמים ציינו כי הוא מיועד למחקר בלבד. מעבר לכך, התמונות מגיעות מקישורים ברשת, כך שעליכם לוודא עצמאית שאין הפרת זכויות יוצרים על התוכן המקורי לפני שאתם מפיצים מוצר.

איך נאסף המידע שבתוך הקבצים?

הנתונים מתבססים על תמונות מתוך פרויקט DataComp. הטקסטים והמיקומים הופקו באופן אוטומטי בעזרת מנוע PaddleOCR וסווגו ל־12 רמות דיוק ופירוט.

האם הקבצים כוללים את התמונות עצמן?

המאגר מחזיק קובצי Parquet עם כתובות אינטרנט לתמונות ומטא-דאטה של הטקסט שחולץ מהן. אין בקבצים תמונות שמורות, ותצטרכו למשוך אותן מהרשת לפי הקישורים אם תרצו את המידע החזותי.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב הרשמי, או מורידים את קובצי ה־Parquet למחשב ופותחים אותם עם pandas. המאגר פתוח ואינו דורש אישור גישה מוקדם או מילוי טפסים. שדות המטא-דאטה והכיתובים שמורים כמחרוזות JSON דחוסות, ולכן צריך להריץ עליהם פענוח כדי לחלץ את הטוקנים, התיבות החוסמות וציוני הביטחון. קחו בחשבון שהמאגר מכיל מטא-דאטה וקישורים בלבד, כך שאם אתם צריכים את התמונות עצמן, תצטרכו להוריד אותן בעצמכם מתוך הכתובות שברשומות.

from datasets import load_dataset

ds = load_dataset("Salesforce/blip3-ocr-200m")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי קוד, אך היוצרים מציינים במפורש שהשחרור מיועד למטרות מחקר בלבד. הנתונים מכילים טקסט שנשאב מתמונות ברשת, והאחריות על זכויות היוצרים של התמונות המקוריות חלה במלואה על מי שמשתמש בהן. אם אתם מתכננים לאמן מודל לשימוש מסחרי, ההסתמכות על תמונות הרשת הללו דורשת בדיקה משפטית זהירה של זכויות המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗