GPT
P

pixmo-docs

קוד פתוח

allenaiodc-by2024-11-26

מאגר שאלות ותשובות סינתטיות שנועד ללמד מודלי ראייה להבין תרשימים, טבלאות ומסמכים ממוחשבים. הוא שימש במקור לאימון סדרת מודלי Molmo של מכון אלן.

  • 4,029הורדות בחודש
  • 35לייקים

מה זה

הנתונים מחולקים לארבעה תתי מאגרים נפרדים: תרשימים, דיאגרמות ותרשימי זרימה, טבלאות, ומסמכים מסוגים אחרים. בכל רשומה יש תמונה שרונדרה מקוד מחשב, ולצידה צמדים של שאלות ותשובות שנבנו סביב התוכן שלה.

תהליך הייצור כאן סינתטי לחלוטין. צוות הפיתוח השתמש במודל קלוד כדי לכתוב קוד שמייצר ומרנדר תמונות גרפיות, ובמקביל הפעיל את GPT-4o mini כדי לחבר שאלות ותשובות בהתבסס על אותו קוד מקור, בלי שהמודל השואל ראה את התמונה המרונדרת עצמה. החלוקה הפנימית כוללת קבוצות אימון וולידציה, אם כי המפתחים מציינים שהחלוקה הזו משקפת את מה שהם הזינו למודלי Molmo ולא נועדה להערכת ביצועים רשמית.

מתאים ל

  • אימון מודלי ראייה לגרפים

    לימוד מודלים רב-מודאליים לקרוא ערכים מתוך תרשימי עמודות, עוגה וגרפים ממוחשבים.

  • הבנת טבלאות ומבנה

    שיפור היכולת לחלץ נתונים מדויקים מתוך תמונות של טבלאות ומסמכים מובנים.

  • פענוח תרשימי זרימה

    אימון מערכות מענה לשאלות על קשרים בין שלבים בדיאגרמות ובתרשימים טכניים.

איפה זה נופל

היוצרים עצמם ממליצים כיום לעבור למאגרים חדשים יותר שלהם, CoSyn-400k ו־CoSyn-point, ומעידים ששם יש קטגוריות רבות יותר ותהליך ייצור משופר. השאלות נוצרו ישירות מהקוד שרינדר את התמונה ולא מהתמונה הסופית, מה שעלול לייצר פערים אם הרינדור לא תאם במדויק את כוונת הקוד. אין במאגר שום ייצוג לשפות שאינן אנגלית או לטקסטים בעברית, והנתונים מייצגים עולם סינתטי ממוחשב ולא מסמכים אמיתיים, סרוקים או מקומטים מהעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הבסיסי הוא ODC-BY, אבל המאגר כפוף להגבלות השימוש של OpenAI ושל Anthropic בגלל האופן שבו המידע נוצר. בנוסף, המפרסמים מציינים שהוא מיועד למחקר ולחינוך לפי הקווים המנחים שלהם. עבור מוצר מסחרי יש כאן סיכון משפטי ברור בגלל תנאי השימוש של ספקיות ה־LLM.

האם יש במאגר תמיכה בעברית או מסמכים מישראל?

לא. כל הקוד, המסמכים והשאלות נוצרו באנגלית בלבד. אם אתם צריכים לאמן מודל שיקרא חשבוניות, טבלאות או תרשימים בעברית, תצטרכו לייצר או לאסוף נתונים מקומיים בעצמכם.

מדוע המפתחים ממליצים להשתמש במאגר אחר במקומו?

צוות AllenAI פרסם גרסאות מתקדמות יותר בשם CoSyn-400k ו־CoSyn-point. המאגרים החדשים כוללים יותר קטגוריות של תמונות ותהליך יצירה שעבר שיפור לעומת התהליך הראשוני ששימש כאן.

איך נוצרו השאלות והתשובות עבור התמונות?

הן לא נכתבו על ידי בני אדם וגם לא נוצרו מהתבוננות בתמונה. מודל Claude כתב קוד שיצר את התמונה, ו־GPT-4o mini קרא את הקוד הזה וחיבר את השאלות והתשובות ישירות ממנו.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון המזהה ושם הקונפיגורציה הרצויה, כאשר ברירת המחדל היא charts. הנתונים שמורים בקובצי פרקט, סך הכל 116 קבצים במאגר, ללא צורך באישור גישה מוקדם או בהרשמה. כל רשומה כוללת ישירות את אובייקט התמונה המרונדר בפורמט תמונה רגיל לצד השאלות והתשובות שמתאימות לה.

from datasets import load_dataset

ds = load_dataset("allenai/pixmo-docs")

הרישיון

המאגר מופץ תחת רישיון ODC-BY הדורש ייחוס, אך השימוש המסחרי בפועל מסובך מאוד. כרטיס המאגר מדגיש שהוא מיועד למחקר ולחינוך, וכפוף לתנאי השימוש ומדיניות השימוש של אנתרופיק עבור הקוד שיוצר בקלוד, ולתנאי השימוש של OpenAI עבור השאלות שיוצרו ב־GPT-4o mini. אם אתם בונים מודל מסחרי, התנאים של ספקיות המודלים הללו עלולים להגביל אתכם.

הרישיון המלא ב־Hugging Face ↗