GPT
C

chinese-cosmopedia

קוד פתוח

opencsgapache-2.02024-09-16

מאגר סינתטי של 15 מיליון רשומות בסינית שנוצרו על בסיס מקורות ידע מגוונים. הוא נותן מענה למי שמאמן מודלים ומחפש טקסטים חינוכיים מובנים במקום סריקות רשת גולמיות.

  • 1,105הורדות בחודש
  • 81לייקים

מה זה

המאגר מכיל 15 מיליון רשומות טקסט סינתטיות בהיקף של כ־60 מיליארד טוקנים. הטקסטים לא נאספו כמו שהם מהרשת, אלא נוצרו על ידי מודל שפה ייעודי בשם OpenCSG-Wukong-Enterprise-Long. המודל קיבל קטעי מקור קצרים מתוך ארבע פלטפורמות תוכן, והרחיב אותם לטקסטים ארוכים ועשירים בהתאם להנחיות ספציפיות.

מקורות הזרע של המאגר כוללים 10,939,121 רשומות מבאיידו בייקה, 2,291,547 שאלות ותשובות מאתר Zhihu, 2,111,009 פוסטים מבלוגים טכנולוגיים, ו־173,671 ערכים מוויקיפדיה בסינית. החלוקה הזו מראה תלות מובהקת באנציקלופדיה המקומית של באיידו כבסיס לרוב התוכן.

מבחינת סגנונות כתיבה, המאגר מחולק לחמישה פורמטים מרכזיים. החלק הגדול ביותר הוא ספרי לימוד לחטיבות ביניים עם 4,677,397 רשומות, ואחריו סיפורים רגילים עם 3,332,288 רשומות, ספרי לימוד אקדמיים עם 3,127,902 רשומות, מדריכים מעשיים בסגנון ויקיהאו עם 2,740,001 רשומות, וסיפורים לפעוטות בני חמש עם 1,637,760 רשומות.

מתאים ל

  • אימון מודלי שפה בסינית

    שימוש ב־60 מיליארד טוקנים לחיזוק יכולות הבנה והבעה של מודל כללי בשפה הסינית.

  • כוונון למערכות הדרכה ולמידה

    אימון מודלים להסברת חומר מורכב דרך סגנונות ספרי הלימוד לחטיבות ביניים ולאקדמיה.

  • יצירת תוכן מודרך וסיפורים

    פיתוח אפליקציות שמייצרות מדריכי צעד אחר צעד או סיפורים מותאמים לגילאי ילדים.

איפה זה נופל

כל התוכן במאגר סינתטי לחלוטין ונוצר במודל שפה, מה שמביא איתו סכנה מובנית של הזיות וטעויות עובדתיות שהמודל הוסיף כשהרחיב את המקורות. בנוסף, מעל שני שלישים מנתוני המקור מגיעים מבאיידו בייקה ו־Zhihu, פלטפורמות שכפופות לצנזורה מחמירה בסין, דבר שמייצר הטיה ברורה בתחומי היסטוריה, פוליטיקה וחברה. כל הטקסטים כתובים בסינית בלבד, אין כאן מילה בעברית או באנגלית, ולא פורטו נהלי סינון אוטומטיים לאיתור שגיאות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מודל מסחרי?

הרישיון הרשמי הוא Apache 2.0, אך יוצרי המאגר דורשים פנייה לאימייל lorraineg@opencsg.com כדי לקבל אישור מסחרי. יש כאן התנגשות בין הרישיון המוצהר לתנאי השימוש שהם כתבו, כך שמי שבונה מוצר לחברה חייב לסגור מולם את ההרשאה הזו.

כמה שוקל הדאטהסט והאם אפשר להריץ אותו מקומית?

המאגר כולל 15 מיליון רשומות בכ־60 מיליארד טוקנים ומחולק ל־64 קובצי Parquet. הורדה מלאה דורשת עשרות עד מאות ג'יגה בייט של אחסון פנוי, לכן עדיף להוריד רק חלק מהקבצים או לעבוד בטעינה מוזרמת.

האם יש במאגר טקסטים בעברית?

אין במאגר עברית בכלל. כל הנתונים נכתבו בסינית ומבוססים על מקורות סיניים בלבד, לכן הוא לא מתאים למשימות עיבוד שפה מקומיות.

איך נוצרו הנתונים בפועל?

הצוות השתמש במודל בשם OpenCSG-Wukong-Enterprise-Long שלקח קטעים מבאיידו, מוויקיפדיה, משאלות Zhihu ומבלוגים טכניים. באמצעות פרומפטים מוגדרים מראש המודל הפך את הקטעים האלה לספרי לימוד, סיפורים ומדריכים.

איך טוענים

הנתונים מחולקים ל־64 קובצי Parquet ששמורים תחת תיקיית data, החל מ־00000.parquet. המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך בהגשת בקשת גישה מקדימה או באישור ידני של היוצרים.

לא מדובר בהורדה קלה של קובץ בודד. 60 מיליארד טוקנים תופסים נפח אחסון משמעותי, כך שמומלץ לעבוד בסטרימינג ישיר או לטעון קבצים ספציפיים לפי הצורך. שדות הרשומה המדויקים לא מפורטים בכרטיס, אך התוכן בנוי סביב הטקסט שנוצר והסגנון שלו.

from datasets import load_dataset

ds = load_dataset("opencsg/chinese-cosmopedia")

הרישיון

המטאדטה מציין רישיון Apache 2.0, אבל הטקסט של היוצרים מטיל תנאי מגביל: שימוש מסחרי במאגר או בתוצרים שלו דורש אישור מפורש במייל, לצד עמידה ברישיון הקהילה של OpenCSG. בפועל זה סותר את אופי הרישיון החופשי, ואם אתם מתכננים מוצר מסחרי, לא כדאי להסתמך על חופש פעולה מלא בלי לקבל מהם אישור כתוב מראש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗