GPT
D

dreambooth

קוד פתוח

googlecc-by-4.02023-08-15

סט קטן של תמונות שנועד לבדוק התאמה אישית של מודלי תמונה לנושא בודד. תקבלו כאן 30 נושאים שונים שמיועדים לבחון שמירה על זהות של אובייקט או חיה.

  • 1,282הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל 30 נושאים שמחולקים ל־15 מחלקות. 9 מתוכם הם בעלי חיים כמו כלבים וחתולים, והשאר 21 חפצים דוממים, כולל תיקים או צעצועים. לכל נושא יש בין 4 ל־6 תמונות בלבד, שמציגות אותו מזוויות שונות, בתנאי תאורה משתנים ובסביבות מגוונות.

חלק מהתמונות צולמו ישירות על ידי החוקרים של גוגל, והשאר הגיעו ממאגר Unsplash. המאגר כולל 162 קבצים בסך הכל. לצד התמונות יש שני קובצי טקסט: אחד מפרט את הפרומפטים והמחלקות ששימשו במאמר המקורי, והשני מרכז קישורים למקורות ב־Unsplash יחד עם שמות הצלמים והרישיונות של כל תמונה.

מתאים ל

  • הערכת שימור זהות

    בדיקת יכולת המודל לייצר נושא ספציפי בסביבות חדשות לפי הפרומפטים מהמאמר.

  • בנצ'מרק להתאמה אישית

    השוואת ביצועים של שיטות fine-tuning שונות על 30 הנושאים הקבועים במאגר.

  • אימון מודל על נושא בודד

    הרצת בדיקות מקומיות מהירות עם 4 עד 6 תמונות בלי צורך להכין דאטה לבד.

איפה זה נופל

זה לא מאגר לאימון מודל בסיס אלא סט צר מאוד של דוגמאות בודדות. יש כאן 30 נושאים בלבד, וכל הטקסטים והפרומפטים נכתבו באנגלית, כך שאין שום ייצוג לעברית. אם אתם רוצים לבדוק ביצועים על בני אדם, כלי רכב או מבנים מורכבים, אין כאן שום מענה לזה, כי הכרטיס מוגבל רק לחתולים, כלבים וחפצים פשוטים. בנוסף, מדובר בפרויקט מחקרי שפורסם באוגוסט 2023 ואינו נתמך רשמית כמוצר של גוגל.

שאלות
נפוצות

האם מותר להשתמש בתמונות למוצר מסחרי?

הרישיון הכללי של המאגר הוא CC-BY 4.0 שמתיר שימוש מסחרי עם מתן קרדיט מתאים. יחד עם זאת, חלק מהתמונות נאספו מ־Unsplash ומחייבות בדיקה של תנאי השימוש והייחוס לצלמים המקוריים. כל הפרטים האלה מופיעים בצורה מסודרת בקובץ references_and_licenses.txt שמצורף למאגר.

כמה המאגר הזה שוקל?

המאגר קטן מאוד וכולל 162 קבצים בלבד. מדובר בסך הכל בכמה עשרות תמונות JPG ברזולוציה רגילה ובשני קובצי טקסט נלווים. אפשר להוריד אותו למחשב תוך שניות בודדות בלי לתפוס נפח אחסון מורגש.

האם יש במאגר תמיכה בעברית?

אין במאגר שום תוכן בעברית. שמות התיקיות, המחלקות והפרומפטים שרשומים בקובץ ההנחיות נכתבו כולם באנגלית בלבד. אם אתם רוצים לבחון מודל שמקבל הנחיות בעברית, תצטרכו לתרגם את הפרומפטים בעצמכם.

איך התמונות נאספו?

חלק מהתמונות צולמו באופן יזום על ידי מחברי המאמר כדי ליצור זוויות מגוונות של חפצים וחיות מחמד. שאר התמונות אותרו והורדו מאתר Unsplash על בסיס התאמה לנושאים שנבדקו במחקר. החוקרים צירפו קישור ישיר לכל תמונה שנלקחה מהאתר כדי לשמור על שקיפות.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה. הקבצים מאורגנים בתיקיות לפי שמות הנושאים כמו backpack או backpack_dog, ובתוכן תמונות בפורמט JPG ממוספרות מ־00 ומעלה. לפני שמתחילים לעבוד, צריך לקרוא את קובץ הטקסט prompts_and_classes.txt כדי להבין לאיזו קטגוריה שייך כל נושא ובאילו פרומפטים החוקרים השתמשו בזמן הבדיקות שלהם.

from datasets import load_dataset

ds = load_dataset("google/dreambooth")

הרישיון

המאגר מופץ תחת רישיון CC-BY 4.0 שמתיר שימוש מסחרי, שינוי והפצה, בתנאי שנותנים קרדיט מתאים ליוצרים. עם זאת, בגלל שחלק מהתמונות נלקחו מ־Unsplash, צריך לעיין בקובץ references_and_licenses.txt ולשים לב לייחוס הפרטני של הצלמים המקוריים לפי הקישורים שמצורפים שם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗