GPT
A

alchemist

קוד פתוח

yandexapache-2.02025-05-15

מאגר קטן של 3,350 זוגות תמונה וטקסט שנועד לכוונון עדין של מודלי תמונה. המטרה היא להעלות את רמת האסתטיקה והמורכבות בלי לפגוע במגוון הסגנונות של המודל המקורי.

  • 221הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל פיצול אימון יחיד עם 3,350 דוגמאות שנבחרו מתוך מאגר מקורי עצום של עשרה מיליארד תמונות רשת. הסינון התבצע בכמה שלבים, כאשר תחילה הוציאו תוכן לא בטוח, תמונות ברזולוציה נמוכה ממגה פיקסל אחד, טשטוש, סימני מים וכפילויות בעזרת מודל איכות תמונה ייעודי, עד שנותרו 300 מיליון תמונות.

בשלב הבא החוקרים הפעילו מודל דיפוזיה כדי לדרג אסתטיקה ומורכבות לפי ניתוח שכבות תשומת לב, ובחרו רק את התמונות המובילות. הטקסטים המצורפים אינם התיאורים המקוריים מהרשת אלא שוכתבו סינתטית כדי להיראות כמו פרומפטים קצרים וטבעיים של משתמשים, ולא כמו תיאורים טכניים עמוסים בפרטים.

מתאים ל

  • כוונון עדין למודלי דיפוזיה

    שיפור מהיר של איכות התוצרים והאסתטיקה במודלים ממשפחת סטייבל דיפיוז'ן באמצעות מספר דוגמאות מצומצם.

  • מחקר על פרומפטים סינתטיים

    בדיקת השפעתם של תיאורי משתמש קצרים לעומת תיאורים ארוכים ומפורטים על התנהגות מודל יוצר תמונות.

  • אימון משלים לרזולוציה גבוהה

    שילוב תמונות נקיות מסימני מים ומטשטוש בשלב האחרון של האימון כדי לחדד פרטים ויזואליים.

איפה זה נופל

הסיכון הגדול ביותר כאן הוא שבירת קישורים, שכן הנתונים מכילים רק כתובות רשת ולא את התמונות עצמן, כך שחלקן עשוי להיעלם מהאינטרנט עם הזמן. בנוסף, המאגר עבר סינון סינתטי מסיבי שמתאים לכוונון אסתטי ממוקד, אך הוא קטן מדי לאימון מודל מאפס ולא ידוע אם הוא מכיל פרומפטים בשפות שאינן אנגלית.

שאלות
נפוצות

האם המאגר כולל את התמונות עצמן?

לא, המאגר מספק קובצי נתונים עם קישורי רשת להורדה, מזהה ייחודי ופרומפט. תצטרכו לכתוב תהליך הורדה שישמור את התמונות מקומית לפני שתוכלו להתחיל באימון.

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי חופשי במאגר הנתונים ובתיאורים. עם זאת, התמונות עצמן נאספו מרחבי הרשת ולכן מומלץ לבדוק את ההיבט המשפטי לגבי התמונות שמורדות מהקישורים.

האם יש במאגר תמיכה בעברית?

לפי התיעוד הפרומפטים שוכתבו באנגלית בסגנון של משתמשים רגילים. אין ציון של עברית או שפות נוספות בתיאורי המאגר.

איך בחרו בדיוק 3,350 תמונות מתוך מיליארדים?

החוקרים סיננו תמונות בעייתיות ומחקות כפילויות, ואז השתמשו במודל דיפוזיה כדי לזהות תכונות אסתטיקה ומורכבות ספציפיות. התמונות עם הציון הגבוה ביותר נבחרו ונכתב עבורן תיאור מחדש.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face ללא צורך בהרשאת גישה מיוחדת, דרך קובץ Parquet בודד או קובץ CSV. המאגר עצמו אינו מחזיק את קובצי התמונה בפועל אלא מכיל רק מזהה, קישור להורדת התמונה מהרשת ואת הפרומפט המשוכתב. המשמעות היא שחובה להריץ סקריפט הורדה עצמאי כדי למשוך את התמונות למחשב המקומי לפני תחילת האימון.

from datasets import load_dataset

ds = load_dataset("yandex/alchemist")

הרישיון

המאגר מופץ ברישיון Apache 2.0 שמתיר שימוש מסחרי, מחקר, שינוי והפצה ללא חובת פתיחת הקוד שלכם, תחת מתן קרדיט בלבד. אם תאמנו עליו מודל, הרישיון חל על הדאטהסט עצמו ולא כובל את משקולות המודל הסופי, אך כדאי לוודא שהשימוש בתמונות שמורדות מהרשת עומד בזכויות היוצרים המקוריות שלהן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗