GPT
P

pixmo-cap

קוד פתוח

allenaiodc-by2024-11-27

המאגר מרכז תיאורי תמונות מפורטים במיוחד באורך ממוצע של כמאתיים מילים. הוא נועד לאימון מודלי ראייה שפה שצריכים פירוט עמוק ולא רק משפט קצר שמזהה עצמים.

  • 1,590הורדות בחודש
  • 48לייקים

מה זה

במקום לתת לאנשים להקליד כמה מילים על תמונה, נתנו למתייגים לדבר על כל תמונה במשך דקה עד דקה וחצי. את התמלולים של ההקלטות האלה העבירו דרך קלוד, שערך אותם לכדי תיאור ארוך ומסודר. המאגר שימש את אלן לאימון מודלי מולמו, וכולל גם את הטקסט הערוך וגם את התמלולים המקוריים שמהם הוא נבנה.

הקולקציה כולה מחולקת לארבעה קובצי פארקט שמכילים את הנתונים לפיצול האימון. הרשומות לא כוללות את קובצי התמונות הממשיים אלא קישורי רשת בלבד, לצד שדה התמלולים ושדה הכתובית המעובדת. מי שמחפש מידע על הליך הסינון או מקור התמונות המקורי לא ימצא לכך פירוט בכרטיס הנוכחי.

מתאים ל

  • אימון מקדים של מודלי ראייה

    לימוד קשרים עמוקים בין תמונה לטקסט ארוך ומפורט במקום להסתפק בכותרות בסיסיות.

  • כוונון עדין למודלי שפה וראייה

    שיפור היכולת של מודל קיים להפיק פסקאות הסבר מפורטות על סמך קלט ויזואלי.

  • מחקר על עיבוד דיבור לטקסט

    השוואה בין תמלולי הדיבור האותנטיים של המתייגים לבין העריכה הסופית שיצר מודל השפה.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על דיבור אנושי שעובד דרך מודל קלוד. הכרטיס לא מציין מאיפה נלקחו התמונות, כמה דוגמאות יש, או מתי הכל נאסף, ולכן אי אפשר לדעת איזה תוכן ייפול בעקבות קישורים מתים. בנוסף, עיבוד דרך מודל שפה חיצוני עלול להכניס הזיות או להשמיט דקויות שהיו בדיבור המקורי, כך שחובה לבדוק התאמה מול התמלול הגולמי לפני שסומכים על התיאורים.

שאלות
נפוצות

האם יש במאגר תמיכה בעברית?

לא. התמלולים והתיאורים מבוססים על דוברי אנגלית ועובדו באנגלית בלבד. אם המודל שלכם מיועד לעברית, תצטרכו לתרגם את הטקסטים או לאסוף דאטה מקומי בעצמכם.

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

זה מורכב ומחייב זהירות. הרישיון הבסיסי הוא או די סי ביי, אבל המפרסמים ציינו ייעוד מחקרי וחינוכי. מעבר לזה, הטקסטים נוצרו באמצעות קלוד וכפופים למדיניות המסחרית של חברת אנתרופיק.

האם קובצי התמונות מגיעים בתוך המאגר?

לא, המאגר כולל רק כתובות אינטרנט של התמונות. תצטרכו להריץ תהליך הורדה נפרד כדי למשוך את התמונות לשרת שלכם לפני שתוכלו להתחיל באימון.

איך המאגר נוצר בפועל?

מתייגים אנושיים דיברו במשך שישים עד תשעים שניות על כל תמונה שהוצגה להם. לאחר מכן, מודל קלוד קיבל את התמלולים של ההקלטות והפך אותם לפסקת תיאור קריאה ומפורטת.

איך טוענים

טוענים אותו ישירות דרך ספריית הדאטהסטס בקוד של שורה אחת, בלי צורך לבקש אישור גישה מראש. הקבצים מגיעים בארבעה חלקי פארקט שמכילים את שדה התמלולים ושדה הכתובית.

נקודת התורפה הטכנית כאן היא התמונות עצמן, שנשמרות כקישורים חיצוניים ולא כקובצי תמונה מוכנים בפארקט. אתם צריכים להוריד אותן בעצמכם מהרשת לפני האימון, מה שאומר שקישורים שבורים ישביתו חלק מהשורות וזמן ההכנה יתארך בהתאם.

from datasets import load_dataset

ds = load_dataset("allenai/pixmo-cap")

הרישיון

הרישיון הרשמי הוא או די סי ביי, שדורש מתן קרדיט בלבד. עם זאת, היוצרים מדגישים שהמאגר מיועד למחקר ולחינוך ומפנים להנחיות השימוש שלהם. הטקסטים נוצרו בעזרת קלוד, ולכן חלים עליהם גם תנאי השירות ומדיניות השימוש של אנתרופיק, נקודה שמסבכת שימוש מסחרי ישיר במודל שתאמנו.

הרישיון המלא ב־Hugging Face ↗