GPT
L

laion-coco-nllb

קוד פתוח

visheratincc-by-nc-4.02023-06-18

תרגום מכונה של תיאורי תמונות ממאגר LAION-COCO ל־200 שפות שונות. הפרויקט מיועד למי שרוצה לאמן מודלים רב לשוניים של תמונה וטקסט בלי להשקיע הון באיסוף דאטה ידני.

  • 1,697הורדות בחודש
  • 45לייקים

מה זה

המאגר מבוסס על דגימות מתוך LAION-COCO, שכוללות תיאור מקורי באנגלית וקישור לתמונה. המחבר לקח את התיאורים האלה ותרגם אותם ל־200 שפות באמצעות המודל הגדול של NLLB-200 עם 3.3 מיליארד פרמטרים, לפי רשימת השפות של Flores 200. הסינון התבסס על ציון אסתטי של LAION, ונכנסו אליו רק תמונות שקיבלו ציון של 4.5 ומעלה, לצד בדיקה שכתובות התמונות היו תקינות בזמן היצירה.

כל רשומה מכילה מזהה תמונה ייחודי, כתובת מקורית, תיאור מקורי באנגלית, ציון אסתטי, ומערך של תרגומים עם קוד שפה בפורמט BCP-47 לצד הטקסט המתורגם. החלוקה הפנימית מורכבת מחלק אימון שמחולק לעשרות קבצים, וחלק בדיקה נפרד.

מתאים ל

  • אימון CLIP רב לשוני

    חיבור תמונות לתיאורים בשפות שונות כדי לאפשר חיפוש תמונות לפי טקסט בשפות שאינן אנגלית.

  • מחקר תרגום מכונה לתמונות

    בדיקת איכות תרגומים אוטומטיים של תיאורי תוכן חזותי מול שפות יעד מגוונות.

  • הערכת מודלי ראייה וטקסט

    בחינת היכולת של מודלים קיימים להבין תיאורי תמונות בשפות עם מעט משאבים.

איפה זה נופל

התרגומים כולם נעשו על ידי מודל NLLB-200 ולא עברו עריכה אנושית, מה שאומר שהזיות, שגיאות דקדוק ותרגום מילולי עיוור נוכחים שם. התמונות לא שמורות בתוך המאגר, כך שתהליך ההורדה תלוי בזמינות של שרת חיצוני או בקישורי אינטרנט של LAION שנוטים להישבר עם הזמן. בנוסף, חתך האיכות האסתטי הוגדר על 4.5 בלבד, כך שלא מדובר בהכרח בצילומים ברמה גבוהה במיוחד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא CC-BY-NC-4.0 שמוגדר לשימוש לא מסחרי בלבד. כל מודל או מוצר שנבנה עליו מוגבל למחקר או לשימוש פנימי לא עסקי.

האם התמונות עצמן נמצאות בתוך הקבצים?

לא, המאגר מכיל רק קובצי Parquet עם טקסטים, ציונים וקישורים. את התמונות מורידים בנפרד משרת ייעודי שהקים המחבר לפי מזהה הרשומה, או מהקישור המקורי של LAION.

איך נוצרו התרגומים לשפות השונות?

התרגומים נוצרו באופן אוטומטי באמצעות מודל NLLB-200 בגרסת 3.3 מיליארד פרמטרים. לא נעשה סינון או תיקון ידני של התוצאות לאחר הריצה.

מה ההבדל בין זה לבין LAION-COCO המקורי?

המאגר המקורי כולל תיאורים באנגלית בלבד. כאן לקחו את אותם תיאורים, סיננו לפי ציון אסתטי של 4.5 ומעלה, ותרגמו אותם ל־200 שפות.

איך טוענים

הדאטה מוגש בפורמט Parquet בחלוקה לקובצי train ו־test, ללא צורך באישור גישה מיוחד. אין בתוכו קובצי תמונה ישירים, אלא רק קישורים ומזהים. כדי להוריד את התמונות עצמן צריך לפנות לשרת חיצוני לפי המזהה, או להסתמך על הכתובת המקורית מהרשת. השדות החשובים לעבודה הם eng_caption לטקסט המקור, captions למערך התרגומים, והמזהה לצורך שליפת התמונה.

from datasets import load_dataset

ds = load_dataset("visheratin/laion-coco-nllb")

הרישיון

הרישיון הוא CC-BY-NC-4.0. המשמעות היא איסור מוחלט על שימוש מסחרי, וחובת מתן קרדיט ליוצר המקורי. אם אתם מתכננים לאמן עליו מודל כדי למכור גישה אליו או להטמיע אותו במוצר עסקי, אי אפשר להשתמש במאגר הזה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗