GPT
S

SexDrugsAndRockAndRoll

קוד פתוח

QuixiAIרישיון לא דווח2024-06-03

  • not-for-all-audiences

תמונות מתויגות של עירום, סמים ותרבות רוקנרול לאימון מודלים מולטימודליים. מי שבונה מנגנוני סינון תוכן או מודל ויז'ואל ימצא כאן דאטה ייעודי לתכנים שרוב המאגרים מנקים מיד.

  • 55הורדות בחודש
  • 71לייקים

מה זה

המאגר מכיל תמונות שמחולקות לשלוש קטגוריות ראשיות: תוכן למבוגרים, דימויים שקשורים בסמים ותרבות רוקנרול. בכל קטגוריה יש תתי סיווגים ברורים. בתחום המבוגרים התמונות מתעדות עירום, אקטים מיניים ומחוות מפורשות. בתחום הסמים תמצאו שימוש בחומרים, כלים ואביזרים ומצבי שכרות, ובקטגוריית הרוק יש הופעות חיות, מוזיקאים ולהקות וסממנים ויזואליים של הז'אנר.

היוצרים מציינים שהתמונות כוללות מטא-דאטה מפורט שמיועד לאפשר זיהוי מדויק של תכנים רגישים, אלימות ועירום. המטרה המוצהרת שלשמה אספו את החומר היא אימון מודל בשם Dolphin Vision. למרות זאת, התיעוד לא חושף מאיזה מקורות הגיעו התמונות בפועל, כמה רשומות יש בכל קטגוריה או איך בדיוק בוצע הסינון והתיוג.

מתאים ל

  • אימון מסנני תוכן

    זיהוי וסיווג אוטומטי של עירום, שימוש בסמים או מחוות בוטות במערכות מולטימודליות.

  • פיתוח מודלי ראייה

    אימון מודלים פתוחים כמו Dolphin Vision על תכנים לא מצונזרים.

  • מחקר על מתינות תוכן

    בדיקת היכולת של מסווגים להבדיל בין הופעת רוק לבין תוכן אלים או אסור.

איפה זה נופל

אין כאן שום מידע על היקף התמונות, מי צילם אותן ומאיזה אתרים הן נלקחו. הקישורים ליצירת קשר בכרטיס הם מתיחה של ריקרול, מה שמראה שהיוצרים לא מתייחסים ברצינות לתיעוד או לתמיכה. אי אפשר לדעת מה טיב ההסכמה של המצולמים, האם יש הטיה דמוגרפית קשה או מה גיל הנתונים. אם אתם בונים מנגנון סינון שמיועד למוצר אמיתי, חובה לבדוק ידנית מדגם גדול כדי לא לחטוף הפתעות משפטיות או תוכן פוגעני שלא נלקח בחשבון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. המאגר פורסם בלי רישיון שימוש, ולכן אין שום הרשאה חוקית להשתמש בתמונות למוצרים מסחריים או להפיץ מודלים שאומנו עליו.

מאיפה נאספו התמונות?

היוצרים לא מפרטים מאיפה הגיע הדאטה ולא מציגים תהליך איסוף מסודר. חלק מהקישורים בתיעוד מובילים לסרטון מתיחה ביוטיוב, כך שאין שקיפות לגבי המקור.

האם יש במאגר טקסטים או תכנים בעברית?

המאגר מבוסס על תמונות ומטא-דאטה באנגלית בלבד. אין בו התייחסות לשפה העברית או לחומרים מקומיים.

איך טוענים

אתם מושכים את הקבצים ישירות מהמאגר של QuixiAI דרך ספריית datasets או בעבודה ישירה עם פנדס. החומר שמור כקבצי parquet, ובין הקבצים הקיימים שם אפשר לראות שמות כמו emotional_dolphin.parquet וגם horny_dolphin.parquet. אין צורך באישור גישה מיוחד כדי להוריד את המאגר. מבחינת שדות, הקבצים כוללים את התמונות עצמן יחד עם תיוגים ברמת הקטגוריה ותת הקטגוריה כדי שתוכלו לבודד סוגי תוכן ספציפיים, כמו שימוש בסמים או עירום, לפני שאתם מתחילים להזין אותם לתהליך האימון של המודל.

from datasets import load_dataset

ds = load_dataset("QuixiAI/SexDrugsAndRockAndRoll")

הרישיון

היוצרים לא הגדירו רישיון למאגר. מבחינה משפטית, כשאין רישיון מוצהר זכויות היוצרים שמורות במלואן למי שיצר או העלה את התמונות, ואסור להשתמש בחומרים למטרות מסחריות או אפילו מחקריות בלי אישור מפורש. אימון מודל על דאטה כזה חושף אתכם לסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗