GPT
I

imagenet.int8

קוד פתוח

cloneofsimoרישיון לא דווח2024-04-26

המאגר מכווץ את כל אימג'נט לגודל 5GB בעזרת קידוד VAE וכימות לשמונה ביט. הוא מיועד למי שמאמן מודלי דיפוזיה ורוצה לחסוך פריקה של 138GB וחישוב חוזר של ייצוגים חבויים.

  • 1,975הורדות בחודש
  • 52לייקים

מה זה

הנתונים כוללים את 1,281,167 התמונות מאימון אימג'נט המקורי, שעברו חיתוך למרכז ושינוי גודל לרזולוציה של 256 על 256 פיקסלים. במקום פיקסלים גולמיים, כל רשומה נשמרת כייצוג חבוי מכווץ שנוצר באמצעות המודל של SDXL VAE, ולאחר מכן עברה כימות לשמונה ביט.

המאגר שמור בפורמט MDS של חברת MosaicML ומחולק לקבצי shard ביחד עם אינדקס. כל דגימה מכילה שלושה שדות עיקריים: הייצוג החבוי עצמו, המזהה המספרי של המחלקה, ושם המחלקה כטקסט באנגלית. אין פה חלוקה מובנית לערכות בדיקה או אימות נוספות, אלא רק נתוני האימון המעובדים.

מתאים ל

  • אימון מודלי דיפוזיה

    אימון ארכיטקטורות כמו DiT ישירות על ייצוגים חבויים מוכנים בלי לבזבז זמן וחישוב על קידוד תמונות.

  • ניסויי ייעול והתכנסות

    בדיקת אלגוריתמים חדשים לאימון דיפוזיה בריצה מקומית ומהירה ישר מתוך זיכרון ה־GPU.

  • הערכת שחזור VAE

    בחינת ההשפעה של כימות לשמונה ביט על שחזור ויזואלי דרך מפענחים שונים.

איפה זה נופל

התמונות עברו חיתוך אגרסיבי למרכז והורדו לרזולוציית בסיס של 256 על 256 בלבד, מה שמוחק פרטים עדינים בקצוות ומגביל את האימון לגודל קבוע. שמות המחלקות קיימים באנגלית בלבד ואין תמיכה בעברית.

נוסף על כך, הכימות לשמונה ביט אמנם שומר על רוב המידע אך עדיין מביא לאובדן דיוק מסוים לעומת נקודה צפה מלאה. המאגר כולל רק את פיצ'ול האימון של אימג'נט המקורי, בלי חלוקת ולידציה עצמאית, כך שלא ניתן להשתמש בו ישירות למדידת ביצועים תקנית בלי להביא נתוני בדיקה ממקור אחר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. המפרסם לא ציין רישיון בדף המאגר, ואימג'נט המקורי עצמו מוגבל היסטורית לשימוש שאינו מסחרי. אימון מודל לחברה מסחרית על המאגר הזה חושף אתכם לסיכוני זכויות יוצרים.

כמה מקום המאגר תופס בדיסק ובזיכרון?

המאגר כולו שוקל כחמישה גיגה בייט בלבד, לעומת כ־138 גיגה בייט של אימג'נט המקורי. בזכות המשקל הנמוך, קל להחזיק אותו בשלמותו בזיכרון המערכת או ב־GPU במהלך ניסויים.

האם יש במאגר שמות מחלקות או תיוגים בעברית?

לא. שדה הטקסט של המחלקות כולל את שמות האובייקטים המקוריים באנגלית בלבד. אם יש לכם צורך בתיוג עברי, תצטרכו לתרגם את רשימת אלף המחלקות באופן עצמאי.

במה המאגר שונה מאימג'נט הרגיל שמורידים בדרך כלל?

הוא לא מכיל קובצי תמונה רגילים כמו JPEG. כל התמונות נחתכו מראש לגודל 256 על 256, הומרו לייצוגים חבויים של SDXL VAE, וכווצו לשמונה ביט בפורמט MDS להזרמה מהירה.

איך טוענים

טוענים את המאגר באמצעות כלי שורת הפקודה של האגינג פייס ישירות למחשב, ולאחר מכן משתמשים בספריית mosaicml streaming. המאגר שוקל כחמישה גיגה בייט בלבד ואין צורך בבקשת אישור גישה מיוחדת כדי להוריד אותו.

בקוד חובה להגדיר מפענח מותאם אישית לפורמט uint8 כדי להמיר את המערך בחזרה למספרים עשרוניים. הנתון החבוי מתקבל כווקטור שטוח, ולכן צריך לבצע לו שינוי צורה ידני לממדים של 4 על 32 על 32 לפני שמזינים אותו למודל או מפענחים אותו חזרה לתמונה.

from datasets import load_dataset

ds = load_dataset("cloneofsimo/imagenet.int8")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. מבחינה מעשית ומשפטית, היעדר רישיון מוגדר מונע שימוש מסחרי בטוח, במיוחד בהתחשב בכך שאימג'נט המקורי כפוף למגבלות שימוש מחקרי בלבד, והייצוגים הופקו דרך המודל של סטביליטי. שימוש בנתונים אלה למוצר מסחרי כרוך בסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗