GPT
P

pixmo-points

קוד פתוח

allenaiodc-by2024-11-27

תמונות עם נקודות ציון מדויקות בפיקסלים לביטויים מילוליים. המאגר נבנה על ידי מתייגים אנושיים כדי לתת למודלים יכולת להצביע על אובייקטים ולספור אותם.

  • 1,798הורדות בחודש
  • 47לייקים

מה זה

המאגר מכיל רשומות שמקשרות בין תיאור טקסטואלי לבין קואורדינטות של נקודות בתוך תמונה. הנתונים נאספו בעזרת מתייגים אנושיים, וכוללים ביטויים פשוטים לצד תיאורים מורכבים יותר, עם דגש על מקרים שבהם אותו ביטוי מופיע לפחות עשר פעמים בפריים בודד. המידע הזה שימש ישירות להקניית יכולות ההצבעה של מודלי Molmo.

בתוך הרשומות תמצאו את הכתובת להורדת התמונה, גיבוב מסוג sha256 לאימות הקובץ, ואת שדה הנקודות שמחזיק קואורדינטות של פיקסלים. יש גם שדה שמגדיר את שיטת האיסוף, שמבדיל בין דגימות שנועדו לספירה בתדירות גבוהה לבין הצבעה כללית.

מתאים ל

  • אימון מודלים להצבעה

    לימוד מודלי ראייה ושפה לחבר בין ביטוי טקסטואלי למיקום מדויק של פיקסל בתמונה.

  • ספירת אובייקטים מרובים

    שימוש ברשומות שמכילות מעל עשר נקודות ללימוד ספירה ואיתור פריטים צפופים.

  • הערכת ביצועי איתור

    בדיקת יכולת המודל להבין תיאורים מורכבים ולאתר את הפריט הנכון בפריים.

איפה זה נופל

התלות בקישורים חיצוניים היא נקודת תורפה רצינית. תמונות ברשת עלולות להיעלם או להשתנות, וזמן ההורדה והאימות שלהן מוטל כולו עליכם. בנוסף, כל התיאורים והביטויים נאספו באנגלית, כך שאין כאן תמיכה בעברית או בהקשרים מקומיים, ותצטרכו לבדוק את טיב הזיהוי מול שפות אחרות בעצמכם.

שאלות
נפוצות

האם התמונות עצמן מגיעות בתוך קובצי הדאטהסט?

לא, הקבצים כוללים רק קישורים וגיבוב לאימות. תצטרכו לכתוב סקריפט שמוריד את התמונות מהרשת ובודק שהקובץ תואם לערך הגיבוב שברשומה. קחו בחשבון שקישורים מסוימים עלולים להישבר עם הזמן.

האם הדאטהסט כולל תמיכה בעברית?

לא, כל התיוגים והביטויים במאגר נאספו באנגלית בלבד. אם המערכת שלכם עובדת בעברית, תצטרכו לתרגם את הנתונים או להשתמש במודל עם יכולות רב לשוניות מובנות. אין כאן דוגמאות מקומיות או התאמה תרבותית לישראל.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הרשמי הוא ODC-BY 1.0 שדורש ייחוס, אך המפתחים הוסיפו הפניה להנחיות שימוש אחראי ולמטרות מחקר וחינוך. לפני שאתם משלבים את הנתונים במוצר מסחרי, מומלץ לקרוא את ההנחיות של המכון כדי לוודא שאינכם מפרים את תנאי הפרסום.

איך נאספו התיוגים והנקודות?

העבודה התבססה על מתייגים אנושיים שסימנו נקודות ספציפיות על גבי תמונות לפי תיאורים מילוליים. המאגר מתמקד גם בביטויים שכיחים שמופיעים מעל עשר פעמים באותה תמונה, כדי לחזק את יכולות הספירה של המודל.

איך טוענים

טוענים את המאגר ישירות עם datasets.load_dataset לפי המזהה, והוא מחולק לשני קובצי Parquet תחת פיצול האימון בלבד. אין צורך באישור גישה מיוחד כדי להתחיל להוריד.

התמונות עצמן אינן שמורות במאגר, אלא מגיעות כקישורי אינטרנט שתצטרכו להוריד בעצמכם בקוד. אותה כתובת תמונה יכולה להופיע שוב ברשומות נפרדות, לכן כדאי לשמור קבצים מקומית ולבדוק את תקינותם מול ערך הגיבוב המצורף.

from datasets import load_dataset

ds = load_dataset("allenai/pixmo-points")

הרישיון

המאגר מופץ תחת רישיון ODC-BY 1.0, שדורש מתן קרדיט בלבד ומאפשר שימוש רחב. עם זאת, המפרסמים ציינו שהוא מיועד למחקר ולחינוך בהתאם להנחיות השימוש האחראי של הארגון. אם אתם בונים מודל למוצר מסחרי, עליכם לוודא שהשימוש שלכם מתיישר עם המגבלות וההנחיות הללו.

הרישיון המלא ב־Hugging Face ↗