GPT
T

textvqa

קוד פתוח

lmms-lab-encoderרישיון לא דווח2024-01-16

גרסה ארוזה של TextVQA שמיועדת לבדיקת מודלים ויזואליים על הבנת טקסט מתוך תמונות. המטרה כאן היא להריץ מדידה ישירה ומהירה של יכולות קריאה בלי להתעסק ביישור נתונים ידני.

  • 44,318הורדות בחודש
  • 24לייקים

מה זה

המאגר מכיל גרסה מובנית של הדאטהסט המוכר TextVQA, שנבנה במקור במחקר של סינג ושותפיו משנת 2019 תחת השם Towards VQA Models That Can Read. הצוות של lmms-lab המיר וארז את הנתונים כדי לתמוך בספריית ההערכה שלהם, lmms-eval, שמריצה בדיקות ביצועים בלחיצה אחת על מודלים רב מודליים גדולים.

הקובץ כולל חלוקה מוגדרת מראש לחלקי אימון ומבחן. לפי מבנה הקבצים במאגר, סט האימון נפרס על פני 20 קובצי פרקט שונים, וסט המבחן מחולק ל־4 קובצי פרקט נוספים. התיעוד בכרטיס לא מפרט שינויים בתוכן המקורי אלא מתמקד בהתאמת הפורמט להרצה ישירה בצנרת הבדיקות.

מתאים ל

  • מבחני ביצועים למודלים

    הרצת בדיקות השוואתיות של יכולת הבנת טקסט בתמונה באמצעות כלי ההערכה lmms-eval.

  • בדיקת יכולות קריאה

    מדידה של ביצועי OCR ומענה על שאלות ויזואליות במודלים רב מודליים.

  • אימון משלים

    שימוש בחלקי ה־train לאימון מודלים מותאמים על שאלות ותשובות מבוססות תמונה.

איפה זה נופל

הכרטיס הנוכחי דל מאוד בפרטים טכניים. היוצרים לא ציינו שום מידע על הטיות, אופן ניקוי השגיאות, שפות הנתונים או תהליך הסינון של התמונות והשאלות. בנוסף, המחקר המקורי שעליו מתבסס הדאטהסט פורסם עוד ב־2019, כך שמדובר בנתונים ותיקים יחסית. מי שמפתח מוצר לא מקבל כאן פירוט של שדות הטקסט המדויקים או כיסוי התוכן, ולכן חובה להוריד דגימה ולבדוק את איכות התיוג ידנית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

לא מומלץ להסתמך עליו למוצר מסחרי. בעמוד המאגר לא הוגדר רישיון כלל, ולכן אין אישור שימוש כתוב. אם אתם חייבים להשתמש בו למוצר, תצטרכו לפנות למקור המקורי של TextVQA ולבדוק מה תנאי ההפצה שלהם.

האם יש בדאטהסט תמיכה בעברית?

הכרטיס לא מדווח על תמיכה בשפות נוספות מעבר לאנגלית. המאגר מתבסס על מחקר TextVQA מ־2019, שמתמקד בטקסטים באנגלית על גבי תמונות. למי שמחפש קריאת עברית בתמונות, הדאטהסט הזה לא יספק מענה.

איך הדאטהסט הזה נאסף ונבנה?

המאגר הנוכחי הוא אריזה מחודשת של דאטהסט TextVQA המקורי מ־2019. היוצרים של lmms-lab לא אספו נתונים חדשים אלא המירו את הקבצים לקובצי פרקט. המטרה שלהם הייתה לאפשר הרצה פשוטה ומהירה דרך ספריית lmms-eval.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה של Hugging Face באמצעות המזהה lmms-lab-encoder/textvqa, או מפעילים אותם ישירות דרך חבילת lmms-eval. המאגר פתוח לגישה ציבורית ללא צורך בהרשאה מיוחדת או אישור מראש. הנתונים שמורים כקבצי parquet, שמחולקים לעשרים חלקי train וארבעה חלקי test, כך שהטעינה יעילה ומאפשרת קריאה בחלקים ללא צורך בהורדת קובץ יחיד כבד.

from datasets import load_dataset

ds = load_dataset("lmms-lab-encoder/textvqa")

הרישיון

בעמוד הדאטהסט לא דווח שום רישיון. המשמעות פשוטה: אין לכם היתר מפורש להשתמש בו לפיתוח מוצרים מסחריים, לאימון מודלים סגורים, או אפילו להפצה מחדש. כל שימוש בו מחוץ למחקר פנימי או להערכה עצמית חושף אתכם לסיכון משפטי, ויחייב בדיקה של תנאי השימוש במאגר TextVQA המקורי.

הרישיון המלא ב־Hugging Face ↗