GPT
V

Visual-CoT

קוד פתוח

deepcs233apache-2.02024-03-22

  • visual question answering

דאטהסט שמתמקד בחשיבה חזותית מבוססת תיחום גיאומטרי (bounding boxes). הוא נועד למי שרוצה לאמן מודלי ראייה-שפה לסמן שלבי ביניים ממוקדים בתמונה לפני שהם עונים על שאלות מורכבות.

  • 4,933הורדות בחודש
  • 63לייקים

מה זה

הדאטהסט מציע דגימות המשלבות שאלה, תשובה ותיחום גיאומטרי של אזורים קריטיים בתמונה, כשחלק מהרשומות כוללות גם שלבי הסקה מפורטים. הנתונים מתחלקים לחמישה תחומים עיקריים שנועדו לכסות מגוון מיומנויות: מסמכים וטקסט לצורכי OCR, הבנה חזותית ברמת פירוט גבוהה לזיהוי הבדלים דקים, ניתוח תרשימים וגרפים, שאלות ותשובות כלליות על תמונות, והסקה על יחסים מרחביים בין עצמים.

במאגר יש שני קובצי אימון מרכזיים. הקובץ viscot_363k.json מכיל כ־363 אלף רשומות ייעודיות למשימות visual chain-of-thought, בעוד שהקובץ viscot_mixed_2m.json מרכז כ־2 מיליון רשומות מעורבות לצורך שחזור מלא של תוצאות המחקר. תיקיית המטא-דאטה כוללת קובצי jsonl ייעודיים לפי מקורות המידע המקוריים, ביניהם CUB ו־DocVQA.

מתאים ל

  • אימון מודלי ראייה להסברתיות

    לימוד מודלים להפיק שלבי חשיבה ותיחום ויזואלי של אזור התשובה בתמונה.

  • שיפור OCR במסמכים

    אימון על נתוני DocVQA כדי לזהות ולנתח טקסטים מורכבים בתוך תמונות.

  • הבנת יחסים מרחביים

    פיתוח מיומנויות הבנה מרחבית וקשרים בין עצמים למשימות ניווט ואינטראקציה.

איפה זה נופל

יש פער מדאיג בין הרישיונות: המטא-דאטה של הדף מציג apache-2.0, אבל גוף התיעוד קובע רישיון לא-מסחרי (Attribution-NonCommercial 4.0) ומדגיש במפורש שהחומר נועד למחקר בלבד וללא כל שימוש בייצור. הנתונים קיימים באנגלית בלבד, כך שאין כאן מענה ישיר לעברית או למסמכים מקומיים. בנוסף, מפתחי המאגר אוסרים במפורש על כל שימוש בתחום הרפואי או בקבלת החלטות קליניות. אם המטרה היא הטמעה במוצר אמיתי, הסתירה המשפטית והמגבלות האלו הופכות את השימוש בו לבעייתי מאוד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

לא מומלץ בכלל. למרות שהשדה של הרישיון במאגר מציג apache-2.0, הטקסט שהחוקרים כתבו בכרטיס מציין רישיון לא-מסחרי מסוג Attribution-NonCommercial 4.0. הכותבים מדגישים במפורש שהנתונים נועדו למחקר בלבד ושכל יישום מסחרי או פריסה בפועל נמצאים מחוץ לתחום.

האם יש בדאטהסט תמיכה בעברית?

לא. הדאטהסט מוגדר באנגלית בלבד וכולל משימות שפה וחזות באנגלית. אם אתם עובדים על פרויקטים מקומיים שדורשים זיהוי מסמכים או שאלות בעברית, תצטרכו לאסוף או לתרגם נתונים ממקורות אחרים.

מה ההבדל בין הדאטהסט הזה לדאטהסטים רגילים של VQA?

בניגוד לשאלות ותשובות רגילות על תמונות, כאן כל דגימה מקושרת לקואורדינטות של תיחום חזותי (bounding box). המטרה היא לא רק לענות על השאלה, אלא להכריח את המודל להתמקד באזור המדויק בתמונה שממנו נגזרת התשובה, לעיתים בליווי שלבי הסקה מפורטים.

מאיפה הגיעו הנתונים שנמצאים במאגר?

החוקרים שילבו ועיבדו נתונים ממקורות קיימים בחמישה תחומים, כולל נתוני טקסט ומסמכים כמו DocVQA ונתוני זיהוי מפורטים כמו CUB. הנתונים רוכזו ונאספו בגרסה זו ביוני 2024 כדי ליצור סט מרוכז של Visual CoT.

איך טוענים

הנתונים מחולקים למספר קבצים, כולל ארכיוני תמונות מפוצלים תחת cot_images_tar_split וקובצי JSON ו־JSONL של הגדרות ומטא-דאטה. אין צורך בבקשת גישה מיוחדת כדי להוריד את 37 הקבצים במאגר. כדי לעבוד איתו בצורה נכונה, צריך לחבר בין התמונות לבין קובצי ה־JSON שמרכזים את השאלות, התשובות והקואורדינטות של התיחום החזותי.

from datasets import load_dataset

ds = load_dataset("deepcs233/Visual-CoT")

הרישיון

קיים כאן בלבול משפטי רציני. המטא-דאטה מציג apache-2.0 המתיר שימוש מסחרי, אך הטקסט הרשמי בכרטיס מגדיר Attribution-NonCommercial 4.0 International ואוסר על כל פריסה בייצור. בפועל, החוקרים מייעדים את המאגר למחקר בלבד, ואי אפשר להסתמך עליו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗