GPT
O

OmniCorpus-CC

קוד פתוח

OpenGVLabcc-by-4.02024-08-30

מאגר ענק של טקסט ותמונות שנקצרו מדפי רשת באנגלית. הוא מציע מיליוני דוגמאות מרובות תמונות ופסקאות עם ציוני איכות מפורטים לכל פריט.

  • 17,484הורדות בחודש
  • 29לייקים

מה זה

הנתונים מגיעים מסריקות עבר של Common Crawl ומחולקים לפי תצורות סריקה שונות, החל משנת 2013 ואילך. כל רשומה כוללת רצף של כתובות תמונה ורצף של פסקאות טקסט שהופיעו יחד במקור, לצד כתובת האתר ושם הדומיין שממנו נשלפו הדברים.

במקום לקבל רק זוג פשוט של תמונה וכיתוב, המבנה כאן מחזיק מערכים של תמונות וטקסטים מתוך אותו עמוד. לצד התוכן הגולמי יש מטא דאטה עשיר ברמת העמוד וברמת התמונה הבודדת. ברמת העמוד מחושבים ציוני הסתברות לשטף שפתי, הימצאות פרסומות, רעילות, פורנוגרפיה ותוכן פוליטי. ברמת התמונה מופיעים ממדי הגובה והרוחב, ערכי גיבוב למניעת כפילויות, ציוני אסתטיקה והסתברות לתוכן לא בטוח.

מתאים ל

  • אימון מודלי ראייה ושפה

    לימוד קשרים בין רצפי פסקאות לתמונות מרובות בעמוד רשת.

  • מענה לשאלות על תמונות

    בניית יכולות הסקת מסקנות מהקשר חזותי וטקסטואלי רחב.

  • מחקר על איכות דאטה ברשת

    בדיקת מתאמים בין ציוני אסתטיקה ורעילות לביצועי מודל.

איפה זה נופל

הטקסט כולו באנגלית בלבד ואין פה עברית בכלל. התמונות אינן שמורות במאגר אלא כקישורים, ולכן חלק משמעותי מהלינקים משנים כמו 2013 או 2014 כבר שבור ולא יוביל לשום קובץ. בנוסף, הנתונים הם פלט של סריקת רשת ישנה עם ציוני מודלים, כך שחובה לסנן את הציונים של תוכן רעיל או לא בטוח לפני אימון כדי לא להכניס זבל למוצר שלכם.

אותה משפחה

OmniCorpus-CC יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור למפרסמים, ללא חובת שיתוף זהה של הקוד או המשקולות שתפיקו.

האם המאגר כולל תמיכה בעברית?

לא. לפי התיעוד הרשמי השפה היחידה בדאטהסט היא אנגלית. מי שבונה מודל ייעודי לעברית לא ימצא כאן תועלת ישירה בטקסטים.

האם התמונות עצמן יורדות עם הדאטהסט?

לא, הקבצים מכילים מחרוזות של כתובות תמונה וטקסטים בלבד. תצטרכו להוריד את התמונות בעצמכם מהאינטרנט, ולקחת בחשבון שחלק מהקישורים הישנים כבר לא פעילים.

מאיפה הנתונים הגיעו?

החומרים נאספו מתוך סריקות של Common Crawl לאורך השנים, החל מ־2013. הצוות חילץ את הדפים, פירק אותם למרכיבים וחישב מגוון ציוני איכות וסינון לכל רשומה.

איך טוענים

טוענים את החלוקות השונות באמצעות ספריית הדאטהסטס ישירות מקובצי פרקט. המאגר כולל 5,920 קבצים, והמשקל הכולל מגיע לעשרות גיגה בייטים של מטא דאטה עוד לפני שהורדתם תמונה אחת. שדות התמונות מכילים מחרוזות ולא קובצי מדיה בינאריים, כך שתצטרכו לכתוב סקריפט הורדה עצמאי כדי למשוך את הקבצים בפועל. הגישה חופשית ואינה דורשת אישור ידני.

from datasets import load_dataset

ds = load_dataset("OpenGVLab/OmniCorpus-CC")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומציינים אם נעשו שינויים. אין דרישה לשתף תוצרי מודלים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗