GPT
C

CoSyn-400K

קוד פתוח

allenaiodc-by2025-02-23

מאגר סינתטי של תמונות מרונדרות מקוד עם שאלות ותשובות שנבנו עליהן. המטרה כאן היא לאמן מודלים רב-מודאליים על תוכן טכני ומסמכים מורכבים בלי תלות בסריקות ידניות.

  • 5,375הורדות בחודש
  • 52לייקים

מה זה

הנתונים מחולקים לעשרה תחומים שונים, ובהם תרשימים, מעגלים חשמליים, מבנים כימיים, נוסחאות מתמטיקה, תווים מוזיקליים, טבלאות ומסמכים. כל רשומה כוללת תמונה שרונדרה מקוד, ולצדה צמדים של שאלות ותשובות שמתייחסים לפרטים שמופיעים בה.

תהליך הייצור לא כלל צילומים מהעולם האמיתי. הצוות השתמש בקלוד כדי לכתוב קוד שמייצר גרפית כל תמונה, ואז הריץ את GPT-4o mini מול הקוד עצמו כדי לייצר את השאלות והתשובות בלי שהמודל ראה את התוצאה המרונדרת. החלוקה לאימון ואימות קיימת, אבל לפי המפתחים היא לא רשמית ולא מיועדת למדידת ביצועים.

מתאים ל

  • אימון VQA טכני

    לימוד מודלים רב מודאליים להבין תרשימים, נוסחאות ומעגלים חשמליים.

  • הבנת מסמכים וטבלאות

    שיפור היכולת לחלץ מידע מתוך טבלאות מורכבות ומסמכים מרונדרים.

  • חימום מודלים לפני כוונון

    אימון מקדים על היקף רחב של נתונים סינתטיים לפני מעבר לדאטה אמיתי.

איפה זה נופל

הנתונים כולם סינתטיים לחלוטין. בגלל שהשאלות נוצרו ישירות מהקוד ולא מהתמונה המרונדרת, שגיאות רינדור או בעיות חפיפה ויזואליות יוצרות פער בין התמונה לטקסט. המאגר לא מתאים להערכה ומשמש רק לאימון. בנוסף, אין בו שום מידע על תמיכה בשפות אחרות כמו עברית, והוא מוטה למבנים טכניים מוגדרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון המוגדר הוא ODC-BY ודורש ייחוס, אך הטקסט והתמונות נוצרו במודלים של אנתרופיק ו־OpenAI. תנאי השימוש שלהם אוסרים לעיתים שימוש בפלט לאימון מודלים מתחרים, וצריך לבדוק את ההשלכות המשפטיות.

האם המאגר כולל עברית?

לא מופיע אזכור לתמיכה בעברית בכרטיס המאגר. התוכן מבוסס על קוד ושפה באנגלית, יחד עם סימונים בינלאומיים כמו נוסחאות מתמטיות ותווים.

האם הדאטה מתאים לבדיקת ביצועים של מודל?

לא. החוקרים מציינים בפירוש שחלוקת האימות אינה מיועדת להערכה, והנתונים נבנו לצורכי אימון בלבד.

איך נוצרו התמונות והשאלות בפועל?

קלוד ייצר קוד שיוצר את התמונה, והקוד הורץ כדי להפיק את הקובץ הוויזואלי. במקביל, GPT-4o mini קרא את הקוד וייצר לפיו את השאלות והתשובות בלי לצפות בתמונה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face, בלי צורך לבקש אישור גישה מוקדם. הנתונים שמורים בקובצי parquet, כאשר רק לחלק של התרשימים יש מעל 50 קבצים מתוך 153 קבצים במאגר כולו.

חובה לציין איזה תת מאגר רוצים למשוך באמצעות פרמטר config, אחרת תקבלו את תרשימים כברירת מחדל. כל שורה מחזירה ישירות אובייקט תמונה של PIL יחד עם שאלות ותשובות, כך שכדאי להביא בחשבון את נפח התעבורה והאחסון בעבודה עם רזולוציות גבוהות כמו 2400 על 1200.

from datasets import load_dataset

ds = load_dataset("allenai/CoSyn-400K")

הרישיון

הרישיון הרשמי הוא ODC-BY, שדורש מתן קרדיט בלבד. עם זאת, התוכן נוצר באמצעות קלוד ו־GPT-4o mini, ולכן השימוש בו כפוף לתנאי השירות ומדיניות השימוש של אנתרופיק ו־OpenAI. אם אתם מתכננים לאמן מודל מסחרי, ההגבלות של ספקיות המודלים עלולות להגביל אתכם.

הרישיון המלא ב־Hugging Face ↗