GPT
R

RenderedText

קוד פתוח

wendlercרישיון לא דווח2023-06-26

  • OCR
  • blender
  • LAION
  • Stability

המאגר כולל 12 מיליון תמונות סינתטיות של טקסט בכתב יד מרונדר בתלת-ממד. הוא מיועד למי שמאמן מודלי ראייה או יצירת תמונה וצריך תיוגים ברמת התו הבודד.

  • 27,420הורדות בחודש
  • 59לייקים

מה זה

מדובר ב־12 מיליון תמונות ברזולוציה של 1024x1024, שנוצרו על ידי Stability AI ו־LAION באמצעות Blender Cycles ו־geometry nodes. כל רשומה מציגה טקסט באנגלית שנראה כמו כתב יד על גבי דף דיגיטלי, תוך שימוש בכ־8,000 גופנים שונים, תאורות מגוונות ממאגר של 643 קובצי HDRI וחומרים מפרויקט ambientCG. הטקסטים עצמם נדגמו ממשפטים בוויקיפדיה, פרויקט גוטנברג, ArXiv, PubMed ו־SODA.

המבנה של המאגר מחולק לשני אזורים בגלל מגבלות אחסון של כמות קבצים לתיקייה. עשרת המיליונים הראשונים נמצאים בתיקיית הבסיס, ושני המיליונים הנוספים יושבים בתיקיית משנה בשם remaining.

מתאים ל

  • אימון זיהוי תווים באנגלית

    זיהוי אותיות וקריאת כתב יד סינתטי בזכות קואורדינטות מפורטות לכל תו בתמונה.

  • בניית מודלי שפה וראייה

    אימון מודלי מולטי-מודל הדורשים הבנה של מיקומי טקסט במרחב התמונה.

  • שיפור טקסט במודלי תמונה

    כוונון מודלי יצירת תמונה כדי לשפר את הדיוק ברינדור אותיות ומילים שלמות.

איפה זה נופל

הנתונים סינתטיים לחלוטין, מה שאומר שהמודל שלכם יתרגל לתאורה וטקסטורות של בלנדר ולא בהכרח יתמודד יפה עם צילומים אמיתיים מהסלולרי. בנוסף, המאגר תומך באנגלית בלבד. אם המוצר שלכם פונה לשוק המקומי בישראל, אין פה עברית, אין תמיכה בכיווניות מימין לשמאל ואי אפשר ללמד ממנו זיהוי כתב יד עברי.

שאלות
נפוצות

האם יש במאגר טקסטים בעברית?

לא, המאגר מוגדר לשפה האנגלית בלבד. כל הטקסטים נדגמו ממאגרי משפטים באנגלית כמו ויקיפדיה, גוטנברג ו־PubMed, והגופנים אינם כוללים אותיות בעברית.

האם מותר להשתמש במאגר למוצר מסחרי?

לא כדאי. המפרסמים לא ציינו רישיון שימוש, והגופנים נלקחו מאתרים חיצוניים ללא פירוט זכויות. במצב כזה, שימוש מסחרי במודל שמאומן עליו מהווה סיכון משפטי.

איך נראים התיוגים בפועל?

כל תמונה מגיעה עם קובץ JSON הכולל את תיבות התיחום של הטקסט כולו ושל כל תו בנפרד. בנוסף מפורטים שם צבע הגופן, זווית הסיבוב ושם קובץ הגופן שבו השתמשו.

כמה דוגמאות יש ואיך הן מאורגנות?

יש בסך הכל 12 מיליון תמונות המחולקות ל־12,033 קובצי tar. עשרה מיליון יושבים בתיקיית השורש, ושני המיליון הנותרים נמצאים בתיקייה בשם remaining.

איך טוענים

הנתונים ארוזים באלפי ארכיוני tar, בסך הכל 12,033 קבצים במאגר. אין צורך בבקשת גישה מיוחדת, אבל תצטרכו להכין מראש צינור עיבוד שיודע לפתוח קבצי tar במקביל ולקרוא את קובצי ה־JSON הנלווים. כל קובץ כזה כולל את הטקסט המלא, צבע וסיבוב הגופן, תיחום יחסי ואבסולוטי של השורה, וקואורדינטות מדויקות לכל תו ותו.

from datasets import load_dataset

ds = load_dataset("wendlerc/RenderedText")

הרישיון

היוצרים לא הגדירו רישיון בכרטיס המאגר. חלק מחומרי התלת-ממד מקורם בנחלת הכלל תחת CC0, אבל הגופנים נאספו מאתרי אינטרנט שונים ולא ברור באילו תנאים הם מופצים. בלי רישיון רשמי וברור, הכנסת המאגר לאימון מודל מסחרי חושפת אתכם לסיכון משפטי, כך שהוא מתאים בעיקר למחקר ובדיקות פנימיות.

הרישיון המלא ב־Hugging Face ↗