GPT
D

DanQing100M

קוד פתוח

DeepGlint-AIcc-by-nc-4.02026-01-05

מאגר ענק של 100 מיליון זוגות תמונה וטקסט בסינית שנאספו מהרשת בשנים 2024 עד 2025. הוא מיועד למי שמאמן מודלי ראייה שפה וצריך תוכן עדכני וממוקד לשפה הסינית.

  • 1,300הורדות בחודש
  • 52לייקים

מה זה

המאגר מכיל 100 מיליון רשומות המורכבות מזוגות של תמונות וכתוביות בסינית, לצד כתוביות קצרות סינתטיות שנוצרו באמצעות המודל GLM4.1-base-9B בעמודת recaption. סך כל הטקסט כולל כ־2.2 מיליארד מילים בסינית, עם נתוני רזולוציה מגוונים עבור התמונות.

כל המידע נאסף מתוך דפי רשת של Common Crawl מהשנים 2024 ועד 2025. כדי לסנן את הנתונים ולבחון את איכותם, החוקרים דגמו 10 מיליון רשומות, הפיקו ייצוגי טקסט עם Chinese-CLIP, והפעילו UMAP ו־HDBSCAN לזיהוי אשכולות סמנטיים בגודל מינימלי של 1,000 דגימות. איכות הטקסט נבדקה בעזרת מודל BERT סיני וניתוח חלקי דיבר עם jieba.

מתאים ל

  • אימון מקדים של מודלי SigLIP

    אימון מודלי ראייה שפה כמו SigLIP2 על זוגות תמונה וטקסט עדכניים להבנת מושגים חדשים בסינית.

  • אחזור בין-מודאלי בסינית

    פיתוח מנועי חיפוש של תמונה לפי טקסט וטקסט לפי תמונה תוך שימוש בתיאורים קצרים ומורחבים.

  • סיווג תמונות Zero-Shot

    הערכה ובניית יכולות סיווג תמונה ללא דוגמאות מוקדמות עבור קטגוריות ומונחים מודרניים.

איפה זה נופל

המאגר מוגבל לשפה הסינית בלבד ואין בו תמיכה בשפות אחרות או בעברית. הנתונים מבוססים על גרידת רשת של Common Crawl, והיוצרים מציינים במפורש שהחומר עלול לכלול תוכן מוטה, רגיש או פוגעני. בנוסף, כל אתר מקור כפוף לתנאים משלו, והסתמכות על הורדת תמונות מכתובות URL ב־Hugging Face עלולה להוביל לקישורים שבורים בגלל שינויים ברשת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. המאגר מופץ תחת רישיון cc-by-nc-4.0 שמגביל את השימוש למטרות לא מסחריות ומחקריות בלבד. אם תאמנו עליו מודל, לא תוכלו למכור שירותים המבוססים עליו או להטמיע אותו במוצר מסחרי.

כמה המאגר שוקל ואיך מורידים את התמונות?

המאגר המלא כולל תמונות שוקל כ־12TB, והוא אינו מאוחסן ישירות בשרתי Hugging Face. בהאגינג פייס יש רק קישורים וכתוביות, וכדי להוריד את קובצי התמונות עצמם צריך להשתמש בפלטפורמת ModelScope.

האם הדאטהסט כולל תמיכה בעברית או באנגלית?

לא, הדאטהסט ממוקד כולו בשפה הסינית ומכיל כ־2.2 מיליארד מילים בסינית. אין בו נתונים בעברית, ולכן הוא רלוונטי רק למודלים שצריכים הבנה ספציפית של טקסט ותרבות סינית מודרנית.

מה מקור הנתונים וכיצד הם נאספו?

הנתונים נאספו מתוך דפי אינטרנט של Common Crawl שפורסמו בשנים 2024 ו־2025. הם עברו תהליכי סינון, חלוקה לנושאים בעזרת BERTopic ובדיקות דחיסות סמנטית ואיכות טקסט.

איך טוענים

טעינת המטא-דאטה מתבצעת ישירות בספריית datasets עם הקריאה load_dataset("DeepGlint-AI/DanQing100M"). אין צורך באישור גישה מיוחד, אבל חשוב לדעת שבהאגינג פייס נמצאים רק כתובות ה־URL של התמונות והטקסטים, כולל עמודת recaption. אם אתם רוצים את קובצי התמונות עצמם, המאגר המלא שוקל כ־12TB וזמין להורדה רק דרך ModelScope באמצעות ספריית modelscope.

from datasets import load_dataset

ds = load_dataset("DeepGlint-AI/DanQing100M")

הרישיון

הרישיון המדווח הוא cc-by-nc-4.0, מה שאומר שהשימוש מותר למטרות מחקר בלבד ואסור לחלוטין לכל שימוש מסחרי. חובה לתת קרדיט ליוצרים. אסור למכור את הדאטהסט או להשתמש בו לאימון מודל שיוטמע במוצר מסחרי, מה שחוסם אותו עבור רוב החברות והסטארטאפים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗