GPT
I

imagenet-1k-vl-enriched

קוד פתוח

visual-layerapache-2.02024-07-09

גרסה מועשרת של ImageNet-1K שמוסיפה לקטגוריות הקלאסיות תיאורים טקסטואליים ותיחום אובייקטים. מתאימה למי שרוצה לאמן מודלים רב-מודאליים על בסיס נתונים מוכר בלי להתחיל לתייג מחדש.

  • 2,941הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל תמונות שמקורן במערך ImageNet-1K המקורי, לצד מזהה ייחודי, תמונות עצמן ותוויות סיווג מתוך אלף הקטגוריות של התחרות ההיסטורית. שמות הקבצים במאגר, כמו סקריפטים להוספת כיתובים ותיבות תוחמות, מעידים על עיבוד שנועד להרחיב את המידע מעבר לסיווג בלבד.

קובצי הנתונים נשמרים בפורמט Parquet בחלוקה למקטעים רבים, כולל עשרות קובצי אימון. המפרסמים לא פירטו בכרטיס את הליך הסינון המדויק או נתונים לגבי חלוקות ולידציה ובדיקה, אך לפי הסקריפטים המצורפים הדגש היה על הוספת נתיבים, כיתובים ותיחומים על גבי הבסיס המוכר.

מתאים ל

  • סיווג תמונות קלאסי

    אימון ובדיקה של רשתות לזיהוי אלף הקטגוריות של המאגר המקורי.

  • מענה על שאלות חזותיות

    שימוש בתמונות לצד הכיתובים כדי לאמן מודלים המשלבים ראייה ממוחשבת ושפה.

  • איתור ותיחום עצמים

    הערכה ואימון של מודלי גילוי אובייקטים בעזרת תיבות התוחמות שנוספו למאגר.

איפה זה נופל

הטקסט והתוויות במאגר קיימים באנגלית בלבד ואין בו שום תמיכה בעברית. הכרטיס אינו מפרט מגבלות תיוג ספציפיות, שיעורי שגיאה בכיתובים שנוספו או הטיות שנבדקו. בנוסף, לא מצוין גודל ההורדה הכולל בדיסק, כך שצריך לבדוק ידנית מדגם של רשומות ולוודא את איכות התיחומים והכיתובים לפני שמריצים אימון כבד.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון המדווח בדף המאגר הוא Apache 2.0, שמתיר שימוש מסחרי ללא תשלום תמלוגים. עם זאת, יש לזכור שהתמונות עצמן מבוססות על ImageNet המקורי, שבו יש לבדוק התאמה לשימוש מסחרי של תכני המקור.

האם יש במאגר נתונים בעברית?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל שמות המחלקות והכיתובים מופיעים באנגלית.

במה המאגר הזה שונה מ־ImageNet הרגיל?

המאגר מבוסס על אותן מחלקות של ImageNet-1K, אך הוא כולל העשרה בנתונים נוספים כמו כיתובים ותיבות תוחמות. בנוסף, הנתונים מאורגנים בקובצי Parquet שמתאימים לטעינה נוחה בסביבות עבודה מודרניות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face, ללא צורך באישור גישה מוקדם או בהרשמה מיוחדת. הנתונים מגיעים ביותר ממאתיים קובצי Parquet, מה שדורש חיבור אינטרנט יציב ונפח אחסון מקומי משמעותי לפריסה של תמונות רבות. השדות העיקריים ברשומות הם image_id, התמונה עצמה בפורמט התואם לספרייה, ותווית הסיווג label שמכילה את אינדקס המחלקה ושמותיה.

from datasets import load_dataset

ds = load_dataset("visual-layer/imagenet-1k-vl-enriched")

הרישיון

הרישיון המדווח במאגר הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, בכפוף לשמירה על הודעות זכויות יוצרים וכתב ויתור. הוא אינו כופה שיתוף באותו רישיון עבור תוצרים שפותחו בעזרתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗