GPT
R

Retrievatar

קוד פתוח

CausalLMcc-by-nc-sa-4.02025-12-14

מאגר רב-לשוני של 100,000 תמונות עם תיאורים מועשרים של דמויות אנימה וידוענים. הוא נועד לעזור למודלים לחבר בין פרצוף למידע רקע מקיף ולא רק לתייג שם.

  • 713הורדות בחודש
  • 75לייקים

מה זה

המאגר כולל 100,000 רשומות מתוך קורפוס סינתטי רחב בהרבה, ומתמקד בשני תחומים עיקריים: דמויות בדיוניות מעולם האנימה וידוענים אמיתיים ממגוון תחומים. במקום להסתפק בהתאמה פשוטה בין שם הדמות למראה החזותי שלה, כל רשומה כוללת תיאור מפורט של הישות והרקע שלה.

התיאורים עצמם לא נכתבו בידי בני אדם אלא נוצרו באופן סינתטי באמצעות מודל Gemini-2.5-pro GA. כדי להימנע מתיאור שטחי של מה שרואים בעין, המודל קיבל לצד תמונת המקור גם מטא-דאטה נרחב ותוצאות חיפוש תמונה הפוך ברשת, תוך שימוש ביכולות עיגון המידע של גוגל דרך ה־API. המידע זמין בארבע שפות: אנגלית, סינית, יפנית וגרמנית, ופורסם בשלב זה כחלק יחיד ללא חלוקה מפורשת לקבוצות אימון ובדיקה נפרדות.

מתאים ל

  • אימון מודלי RAG חזותיים

    חיבור מודלי שפה ותמונה לידע חיצוני על דמויות ואנשים מוכרים.

  • מחקר הבנת ישויות במולטימודל

    בדיקת יכולת המודל לקשר בין פנים של ידוען להיסטוריה שלו.

  • כיתוב תמונות מבוסס רקע

    יצירת תיאורי תמונה עמוקים מעבר לזיהוי חזותי יבש של תווי פנים.

איפה זה נופל

ההגבלה הראשונה והברורה ביותר למי שבונה שירות מקומי היא השפות: אין כאן עברית בכלל, אלא רק אנגלית, סינית, יפנית וגרמנית. מעבר לזה, המאגר הוא סינתטי לחלוטין ונבנה באוגוסט 2025. כל מה שקרה לדמויות או לידוענים אחרי התאריך הזה פשוט לא קיים בטקסט, וההסתמכות על חיפוש רשת של מודל שפה אומרת שעלולות להיות שגיאות עובדתיות או הזיות שהשתרבבו לתיאורים. המיקוד צר מאוד ומוגבל לידוענים ואנימה, כך שהוא לא יעזור בזיהוי עצמים כלליים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא cc-by-nc-sa-4.0 והוא אוסר שימוש מסחרי מכל סוג שהוא. הוא מתאים לניסויים ומחקר אקדמי בלבד.

האם יש במאגר נתונים בעברית?

אין עברית כלל. השפות הנתמכות לפי כרטיס המאגר הן אנגלית, סינית, יפנית וגרמנית בלבד.

איך נוצרו התיאורים של התמונות?

התיאורים יוצרו על ידי מודל Gemini-2.5-pro GA. הוא קיבל את התמונה, מטא-דאטה ותוצאות מחיפוש תמונה הפוך ברשת כדי לכתוב תיאור עובדתי מדויק.

מתי המידע הזה נאסף והאם הוא מעודכן?

בניית הנתונים הסינתטיים הסתיימה באוגוסט 2025. המידע משקף את מה שהיה זמין ברשת באותו חודש ולא כולל אירועים מאוחרים יותר.

איך טוענים

הנתונים יושבים במבנה Parquet שמחולק ל־68 קבצים ממוספרים, train-00000-of-00067 עד train-00067-of-00067, ללא דרישה לאישור גישה מיוחד. אפשר למשוך אותם ישירות דרך ספריית datasets הרגילה של Hugging Face. המאגר מיועד למשימות משולבות של תמונה וטקסט, כך שכל דוגמה כוללת את התמונה עצמה לצד תיאורי הטקסט והמטא-דאטה שסופק למודל בזמן ההפקה. בגלל כמות הקבצים והעובדה שמדובר בתמונות, כדאי לטעון אותם בהזרמה או לוודא מראש שיש מספיק מקום אחסון בדיסק המקומי לפני שמתחילים להוריד את כל החבילה.

from datasets import load_dataset

ds = load_dataset("CausalLM/Retrievatar")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. זה אומר שאסור להשתמש בו לאימון מודלים מסחריים או לשום מטרה שמניבה רווח. בנוסף, חובה לתת ייחוס ליוצרים, ואם משנים את הנתונים או בונים עליהם נגזרות למחקר, חייבים לשחרר אותם תחת אותו הרישיון בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗