GPT
P

pseudo-camera-10k

קוד פתוח

bghiracc2023-08-14

עשרת אלפים תמונות מגוונות ברזולוציה גבוהה של צלמים מקצועיים, עם תיוג אוטומטי מפורט. המאגר מתמקד במושגים ויזואליים מורכבים, כולל צילומי קבוצות ממוספרים שקשה למצוא במקומות אחרים.

  • 1,215הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל עשרת אלפים תמונות שנאספו מצלמים מקצועיים, בלי הגדלה מלאכותית של רזולוציה אלא רק כיווץ איכותי שבו הצלע הקצרה הוגדרה לרוחב או גובה של 1024 פיקסלים. כחצי מהתמונות הן צילומי משפחה וקבוצות שבהם יש תיעוד של מספר האנשים המופיעים בפריים, לצד סצנות מורכבות כמו סמטאות עירוניות, דגלים ופרטים ארכיטקטוניים.

לפי רשימת הקבצים המאגר כולל מעל 24,000 קבצים בפורמט תמונה, בהם קבצי עיבוד בתיקיית canny שמציגים מפות קווי מתאר. התיאורים הטקסטואליים של התמונות נוצרו באמצעות מודל הראייה CogVLM, שרץ בקצב של כמעט ארבע שניות לכל תמונה כדי לייצר כיתובים מפורטים.

מתאים ל

  • אימון מודלי טקסט לתמונה

    לימוד מושגים מורכבים ופרטי תאורה באמצעות תמונות חדות ברזולוציה של 1024 פיקסלים.

  • ספירת אנשים בתמונות

    אימון מערכות לזיהוי כמות דמויות בזכות חצי מהמאגר שמכיל צילומי קבוצות מתויגים.

  • אימון מודלי ControlNet

    שימוש בקבצי קווי המתאר המוכנים מראש מתיקיית canny לצורך שליטה בקומפוזיציה.

איפה זה נופל

התמונות אמיתיות ולכן כוללות רעש טבעי של מצלמות, שהמודל שלכם ילמד אם לא תנקו אותו. הכיתובים נוצרו בצורה אוטומטית על ידי מודל ראייה ולא עברו בדיקה ידנית מלאה, ולכן יש בהם אי דיוקים. בנוסף, עשרת אלפים תמונות זה מאגר קטן שלא מייצג את המגוון הקיים במאגרי ענק, ואין בו שום תוכן או כיתוב בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

הרישיון מוגדר רק בתור cc כללי בלי לפרט את התנאים המדויקים. בכרטיס כתוב שהתמונות חופשיות ונועדו לאימון מודלים, אך חוסר הפירוט עלול לחשוף אתכם לתביעות במוצר מסחרי. מומלץ לבדוק את מקור התמונות המקורי לפני שמשלבים אותן במודל שנמכר ללקוחות.

האם יש במאגר תמיכה בעברית?

אין במאגר שום עברית. כל התיאורים נוצרו באנגלית באמצעות מודל CogVLM, ושמות הקבצים מנוסחים באנגלית בלבד. אם אתם רוצים לאמן מודל להבנת טקסט בעברית, תצטרכו לתרגם את התיאורים בעצמכם.

איך אספו ויצרו את הנתונים?

יוצר המאגר אסף עשרת אלפים תמונות חופשיות של צלמים, והקטין אותן באלגוריתם ששומר על החדות. לאחר מכן הופעל מודל הראייה CogVLM על שרת A100 כדי לחלץ תיאורים מפורטים לכל תמונה בקצב של כארבע שניות לתמונה. בנוסף נוצרו מפות קצוות בתיקיית canny עבור חלק מהקבצים.

במה המאגר הזה שונה ממאגרי תמונות רגילים ברשת?

הוא מתמקד באיכות טכנית גבוהה של צלמים מקצועיים בלי תמונות מטושטשות שהוגדלו מלאכותית. בנוסף, חצי ממנו מתמקד בבעיה הספציפית של ספירת אנשים בצילומי קבוצות ומשפחה. התיאורים בו ארוכים ומפורטים בהרבה מכיתובים סטנדרטיים שנלקחים מטקסט חלופי באתרי אינטרנט.

איך טוענים

המאגר זמין להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מיוחד. הוא מכיל 24,104 קבצים, כולל תיקיית canny ותמונות png ששמות הקבצים שלהן מכילים תיאורים טקסטואליים ארוכים באנגלית. אין פה חלוקה מובנית לחלקי אימון ומבחן, כך שתצטרכו לכתוב סקריפט משלכם שיפרק את התיקיות, יטען את התמונות ויקשר בינן לבין הכיתובים.

from datasets import load_dataset

ds = load_dataset("bghira/pseudo-camera-10k")

הרישיון

המאגר מוגדר תחת רישיון cc כללי, אך המפרסם לא ציין את התת סוג המדויק כמו ייחוס, שיתוף זהה או הגבלה מסחרית. הכרטיס מציין שהתמונות חופשיות ונועדו לאימון מודלים, אך בהיעדר הגדרה משפטית ברורה של גרסת הרישיון, שימוש במוצר מסחרי כרוך בסיכון משפטי ודורש בדיקה מעמיקה של מקור התמונות.

הרישיון המלא ב־Hugging Face ↗