GPT
P

pokemon-blip-captions-en-zh

קוד פתוח

svjackcc-by-nc-sa-4.02022-10-24

תמונות פוקימון עם תיאורים באנגלית ובסינית שנוצרו במודלים אוטומטיים. מאגר זעיר שמתאים למי שרוצה לבדוק יצירת תמונות מטקסט דו לשוני בלי להוריד מאות גיגה בייטים.

  • 479הורדות בחודש
  • 54לייקים

מה זה

המאגר מכיל תמונות של פוקימונים שנלקחו במקור מפרויקט FastGAN, ומיועד לאימון מודלים של תמונה מטקסט. בכל שורה יש תמונת JPEG בגודל משתנה ושני תיאורים טקסטואליים, אחד באנגלית ואחד בסינית. המאגר מציע פיצול יחיד לאימון בלי חלוקה מובנית לולידציה או בדיקה.

הטקסטים כאן לא נכתבו על ידי בני אדם. התיאורים באנגלית הופקו אוטומטית באמצעות מודל BLIP על בסיס התמונות המקוריות, והגרסה הסינית היא תרגום מכונה של התיאורים האלה שבוצע דרך DeepL. אין כאן סינון ידני מתועד או תיוג אנושי, אלא שרשרת עיבוד ישירה מתמונה לכיתוב באנגלית ומשם לסינית.

מתאים ל

  • ניסויי text-to-image

    אימון בדיקה מהיר של מודלים ליצירת תמונות מטקסט שבודק איך המערכת מגיבה לפרומפטים באנגלית או בסינית.

  • בדיקת צינורות עיבוד

    הרצה מקומית של קוד אימון כדי לוודא שטעינת קובצי Parquet ותמונות עובדת חלק לפני שעוברים למאגרים גדולים.

  • הערכת תרגום והזיות

    השוואה בין התיאור האנגלי של BLIP לתרגום הסיני כדי למדוד איבודי מידע בהפקת תמונות דו לשונית.

איפה זה נופל

ההיקף פה זעיר ולא מגיע אפילו לאלף דוגמאות, מה שלא מספיק לאימון מודל יציב מאפס אלא רק לכוונון עדין מאוד ספציפי. מעבר לזה, מדובר במידע סינתטי כפול שכולל הזיות אפשריות של מודל הראייה BLIP ושגיאות תרגום אוטומטי מ DeepL. אין במאגר עברית כלל, אלא רק אנגלית וסינית. התמונות הן סביב נושא אחד מוגבל של פוקימונים מ 2022, כך שאין פה שום מגוון חזותי שרלוונטי לעולם האמיתי או למוצר כללי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא, הרישיון של המאגר הוא cc-by-nc-sa-4.0 שאוסר שימוש מסחרי מכל סוג. בנוסף, חובה לשתף כל נגזרת באותו הרישיון ולתת קרדיט ליוצר המקורי. אם אתם בונים משהו שנועד להכניס כסף, תצטרכו לחפש מקור אחר.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית בכלל. השדות הקיימים מכילים רק אנגלית וסינית שתורגמה ממנה ישירות. אם אתם צריכים עברית לפרויקט שלכם, תצטרכו לתרגם את השדות האנגליים באופן עצמאי.

איך נוצרו הנתונים והתיאורים במאגר?

התמונות נלקחו ממאגר פוקימונים של פרויקט FastGAN, והתיאורים באנגלית נוצרו באמצעות מודל BLIP על פי התמונות. לאחר מכן, התיאורים האנגליים תורגמו לסינית באמצעות שירות DeepL. כל התהליך מבוסס על מודלים ללא מגע יד אדם.

מה ההבדל בין המאגר הזה לגרסה המקורית של lambdalabs?

הגרסה המקורית של lambdalabs הכילה רק תמונות ותיאורים באנגלית שהופקו על ידי BLIP. המאגר הנוכחי לקח את אותם נתונים בדיוק והוסיף להם עמודה של תרגום לסינית. מבנה התמונות והתוכן האנגלי נשארו זהים למקור.

איך טוענים

טוענים אותו ישירות דרך ספריית datasets באמצעות המזהה של המאגר, בלי צורך באישור גישה או מפתחות מיוחדים. כל הנתונים מרוכזים בקובץ Parquet יחיד שמכיל פחות מאלף רשומות, כך שההורדה לוקחת שניות בודדות ולא דורשת מקום מיוחד בדיסק. השדות שמעניינים אתכם הם image שמחזיר אובייקט תמונה, en_text לתיאור האנגלי, ו zh_text לתיאור הסיני. קחו בחשבון שאין כאן חלוקה מראש לסט בדיקה, אז תצטרכו לפצל את הנתונים בעצמכם בקוד לפני שמתחילים לרוץ.

from datasets import load_dataset

ds = load_dataset("svjack/pokemon-blip-captions-en-zh")

הרישיון

המאגר מופץ ברישיון cc-by-nc-sa-4.0 שמיועד לשימוש לא מסחרי בלבד. אתם מחויבים לתת ייחוס ליוצר, ואם אתם משנים, מעבדים או בונים על בסיס הנתונים האלה, אתם חייבים להפיץ את התוצר תחת אותו רישיון בדיוק. מודל שאומן על הדאטהסט הזה מושפע מהתנאים האלה ולא תוכלו לשלב אותו במוצר שמייצר הכנסה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗