GPT
A

AnyWord-3M

קוד פתוח

stzhaoapache-2.02024-07-04

  • images

מאגר שמחבר תמונות עם טקסט מובנה בשפות מרובות עבור מודלים של יצירת תמונה מטקסט. הוא מתאים למי שרוצה ללמד מודל לייצר שלטים, כרזות וכריכות ספרים בלי למרוח אותיות.

  • 4,048הורדות בחודש
  • 17לייקים

מה זה

המאגר כולל 3,034,486 תמונות שנאספו ממאגרים ציבוריים כמו Noah-Wukong ו־LAION-400M, לצד נתוני זיהוי תווים קיימים כמו ArT, COCO-Text, RCTW ו־LSVT. התמונות מציגות סצנות רחוב, מודעות פרסום, כרזות סרטים וכריכות ספרים שמכילות כיתוב אמיתי.

הצוות עיבד את התמונות באמצעות מודלי זיהוי ואיתור של PP-OCR, והפיק תיאורים טקסטואליים בעזרת BLIP-2. החלוקה הפנימית מורכבת מאימון והערכה, כאשר סט ההערכה מונה 1,000 תמונות לבדיקת דיוק באנגלית ובסינית, וסט האימון כולל כ־1.6 מיליון תמונות בסינית, 1.39 מיליון באנגלית, וכעשרת אלפים תמונות בשפות אחרות כמו ערבית, יפנית, קוריאנית, בנגלית והינדי.

מתאים ל

  • אימון יצירת טקסט ויזואלי

    לימוד מודלי דיפוזיה להפיק שלטים, כרזות ומודעות עם אותיות קריאות בסינית ובאנגלית.

  • מחיקה ועריכת כיתוב

    פיתוח מודלים לעריכת תמונה שמשנים או מחליפים טקסט קיים בסצנות רחוב ועטיפות ספרים.

  • הערכת ביצועי מודלים

    בדיקת איכות יצירת כיתוב באמצעות סט המבחן המובנה שמכיל אלף דוגמאות מפולטרות.

איפה זה נופל

ההטיה המרכזית היא שפתית, כמעט כל המאגר נשען על סינית ואנגלית. עשרת אלפים דוגמאות בלבד מכסות יחד ערבית, יפנית, קוריאנית, בנגלית והינדי, כך שאי אפשר להסתמך עליו לאימון שפות אלה ברמה גבוהה. עברית כלל לא מופיעה ברשימת השפות שנסרקו או נבדקו.

בנוסף, חלק ניכר מהתיוג והתיאורים מבוסס על מודלים אוטומטיים של PP-OCR ו־BLIP-2. אם המודלים האוטומטיים פספסו אותיות או יצרו תיאור שגוי, השגיאות האלה נמצאות עמוק בתוך נתוני האימון שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מאפשר שימוש מסחרי, שינוי והפצה של התוכן. אתם רק נדרשים לתת קרדיט מתאים ולצרף עותק של הרישיון המקורי.

האם הדאטהסט מכיל תמונות עם טקסט בעברית?

לא. המאגר מצהיר על סינית, אנגלית ומעט יפנית, קוריאנית, ערבית, בנגלית והינדי. עברית אינה חלק מהאיסוף או הבדיקות שנעשו.

איך נאספו תיאורי התמונות והמיקומים של האותיות?

הנתונים נלקחו ממאגרים קיימים כמו LAION-400M ו־Wukong, לצד דאטהסטים של OCR. הטקסט חולץ וזוהה אוטומטית באמצעות PP-OCR, ותיאורי התמונות הופקו עם מודל BLIP-2.

איך טוענים

המאגר שמור בגרסה V1.1 וכולל 210 קבצים בפורמט parquet, כמו OCR_Art/train_1.parquet, המחולקים לפי מקורות המידע. הגישה אליו חופשית לחלוטין ללא צורך בהרשמה מוקדמת או אישור מיוחד של היוצרים.

לפני הטעינה צריך לקחת בחשבון נפח אחסון משמעותי ליותר משלושה מיליון רשומות. השדות המרכזיים כוללים את התמונות, זיהוי מיקומי הטקסט שחולץ או תויג, ותיאורי התמונה שנוצרו על ידי BLIP-2.

from datasets import load_dataset

ds = load_dataset("stzhao/AnyWord-3M")

הרישיון

המאגר מופץ ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. מודלים שתאמנו על הדאטהסט אינם מחויבים להיפתח תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗