GPT
C

civitai-top-nsfw-images-with-metadata

קוד פתוח

wallstoneaiapache-2.02025-07-07

  • image
  • CivitAI
  • not-for-all-audiences

המאגר מרכז מעל ששת אלפים תמונות למבוגרים שנוצרו במודלי תמונה ופורסמו בקהילת CivitAI. הוא מיועד למי שרוצה לאמן מודלים לסינון תוכן בוטה או לכוונן פרומפטים מורכבים.

  • 2,063הורדות בחודש
  • 68לייקים

מה זה

המאגר כולל 6,537 תמונות שנאספו ישירות מאתר CivitAI ביוני 2025. הבחירה בתמונות האלו נעשתה לפי כמות התגובות והאינטראקציות החיוביות שהן קיבלו באתר, כך שמדובר בתוכן פופולרי במיוחד בקהילה ולא בדגימה מקרית.

המבנה הפנימי פשוט לגמרי. יש תיקיית תמונות עם קובצי JPEG ממוספרים, וקובץ מטא-דאטה יחיד בשם prompts.json. המידע לכל תמונה כולל את הפרומפט המלא ששימש ליצירה שלה, ודירוג חומרת תוכן באחת משלוש רמות: Soft, Mature או X. הפרומפטים עצמם מגיעים ישירות ממחוללי תמונות ומכילים תגיות ייעודיות והפניות לתוספי LoRA שונים.

מתאים ל

  • אימון מסנני תוכן בוטה

    זיהוי וסיווג תמונות לפי רמות חומרה של עירום ותוכן מיני כדי לחסום הצגה שלהן.

  • ניתוח פרומפטים מורכבים

    חקר מבנה ההנחיות והתגיות שמשתמשים מתקדמים כותבים עבור מחוללי תמונה פתוחים.

  • כוונון מחוללי תמונה

    אימון עדין של מודלי יצירה על סגנונות ספציפיים ותיאורי גוף מפורטים באנגלית.

איפה זה נופל

הטקסטים מוגבלים לחלוטין לשפה האנגלית, ואין פה ייצוג לשפות אחרות. מעבר לזה, המאגר מבוסס רק על יצירות שהגיעו לפסגת הדירוגים ביוני 2025, מה שיוצר הטיה חזקה לטובת סגנונות ספציפיים ופופולריים מאוד באותה תקופה, כמו מודלים מסוג פוני. הפרומפטים כוללים קריאות טכניות פנימיות ל־LoRA שלא יעבדו במערכות אחרות בלי ניקוי מוקדם, והקטלוג לרמות תוכן נשען על המערכת של CivitAI ולא על תיוג אנושי אחיד ומבוקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

הרישיון המוגדר במאגר הוא Apache 2.0, ולפי תנאיו מותר להשתמש בנתונים לפיתוח מסחרי. יש חובה לתת ייחוס מתאים ולצרף את עותק הרישיון המקורי. כדאי לזכור שהתמונות נאספו ממשתמשי קצה, ולכן כדאי להפעיל שיקול דעת משפטי לגבי חומרי המקור עצמם.

כמה מקום המאגר תופס על הדיסק?

המאגר כולו שוקל 1.1 גיגה-בייט. הוא כולל 6,537 תמונות בפורמט JPEG לצד קובץ טקסט יחיד של מטא-דאטה. אפשר להוריד ולעבד אותו בלי צורך בשרתים כבדים או באחסון מיוחד.

האם יש תמיכה בעברית?

אין במאגר עברית בכלל. כל הפרומפטים והתגיות נכתבו באנגלית ומיועדים למודלים שמבינים אנגלית בלבד. אם המטרה היא זיהוי טקסט מקומי, המאגר הזה לא יסייע.

מאיפה המידע הזה הגיע ואיך הוא סונן?

הקבצים נאספו מתוך פוסטים באתר CivitAI במהלך חודש יוני 2025. הסינון התבסס על פופולריות בלבד, כלומר תמונות שצברו את כמות התגובות הגבוהה ביותר בקהילה. לצד כל תמונה נשמרה רמת ה־NSFW כפי שהוגדרה במערכת המקורית.

איך טוענים

אין פה צורך בהרשאות מיוחדות או באישור גישה. מורידים את הקבצים ישירות מהמאגר של Hugging Face. הנפח הכולל עומד על 1.1 גיגה-בייט, שזה משקל קל מאוד שמתאים גם להורדה מהירה במחשב מקומי. המטא-דאטה יושב כולו בקובץ JSON אחד, כך שצריך לקרוא אותו כ־dictionary ולקשר בין שמות קובצי התמונות לבין הפרומפט ורמת ה־NSFW שמוגדרת להם.

from datasets import load_dataset

ds = load_dataset("wallstoneai/civitai-top-nsfw-images-with-metadata")

הרישיון

המאגר פורסם תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומחקר חופשי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. מותר להשתמש במידע כדי לאמן מודלים חדשים בלי לחייב פתיחה של הקוד שפיתחתם באותו רישיון. עם זאת, התמונות עצמן נוצרו במקור על ידי משתמשי קהילה, כך שמומלץ לבדוק את ההיבט המשפטי של שימוש ישיר ביצירות עצמן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗