GPT
T

TeleChat-PTD

קוד פתוח

Tele-AIapache-2.02024-01-08

מאגר ענק של כמאתיים ושבעים מיליון רשומות טקסט בסינית לאימון מקדים של מודלי שפה. הוא מיועד למי שבונה מודל בסיס וצריך קורפוס סיני נקי ומסונן בהיקף רחב.

  • 1,132הורדות בחודש
  • 177לייקים

מה זה

המאגר כולל כמאתיים ושבעים מיליון רשומות של טקסט בסינית בלבד, שנלקחו מתוך קורפוס האימון המקדים של מודל הדגל TeleChat. מקורות המידע העיקריים הם דפי רשת, ספרים וערוצי תקשורת רשמיים. הטקסטים חולצו ונארזו במטרה לספק בסיס אימון נקי ורחב יחסית, כשהמידע מחולק על פני מאה שמונים ותשעה קבצים דחוסים בסך הכל.

תהליך עיבוד הנתונים כלל ארבעה שלבים ברורים. תחילה הופעלו חוקים היוריסטיים וסינון על פי אורך הטקסט, ולאחר מכן בוצע ניקוי של כפילויות על בסיס דמיון בין קטעים. בהמשך דורגו הטקסטים באמצעות מודלים ייעודיים כמו BERT ו־GPT-2 כדי לסנן החוצה תוכן באיכות ירודה, ולבסוף הוסרו נתונים בעייתיים או בלתי הולמים כדי להבטיח עמידה בתקני בטיחות תוכן.

מתאים ל

  • אימון מודלי שפה בסינית

    אימון מקדים של מודלי בסיס או המשך אימון למודלים קיימים שדורשים יכולות מתקדמות בסינית בלבד.

  • הערכת ביצועי שפה

    בדיקת איכות של מודלים קיימים על גבי טקסטים מגוונים ממקורות תקשורת, ספרות ואתרי אינטרנט סיניים.

  • סינון וניתוח טקסטואלי

    בניית מאגרי מידע ומחקרי שפה על בסיס נתונים שעברו מראש סינון כפילויות ודירוג איכות אוטומטי.

איפה זה נופל

התוכן כולו מורכב מסינית בלבד. אין כאן מילה אחת בעברית, אנגלית או שפות אחרות, כך שהוא חסר תועלת לחלוטין עבור אימון מודלים לשוק המקומי או למשימות רב לשוניות. בנוסף, הנתונים הגיעו ממקורות רשת ותקשורת רשמית בסין ועברו סינון ביטחון קפדני לפי הסטנדרטים הממשלתיים שם, מה שמייצר הטיות פוליטיות ותרבותיות מובהקות שצריך לבדוק היטב לפני שימוש.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפרויקטים מסחריים בישראל?

עמוד המאגר מסומן תחת Apache 2.0, אבל תנאי הרישיון של Tele-AI בקובץ הנספח דורשים אישור מפורש. מי שמתכנן להוציא מוצר מסחרי ממודל שאומן על המאגר צריך להגיש בקשה למייל הרשמי של החברה ולקבל רישיון מסחרי ייעודי.

כמה נפח אחסון נדרש כדי להוריד ולפתוח את הקבצים?

הקבצים המכווצים תופסים כארבע מאות ושמונים גיגה בייט במאגר. ברגע שפותחים את כולם לקראת עיבוד ואימון, הנפח הכולל מגיע לכטרה בייט אחד של טקסט נקי.

האם המאגר כולל טקסטים בעברית או באנגלית?

לא. המאגר מוגדר ומכיל טקסט סיני בלבד. אין בו מקורות רב לשוניים ואי אפשר להשתמש בו ישירות לשיפור יכולות בעברית.

איך נאספו וסוננו הרשומות לפי הדיווח?

הנתונים נאספו מרשת האינטרנט, ספרים וערוצי תקשורת רשמיים. הצוות הפעיל חוקים לסינון אורך, הסיר כפילויות באמצעות אלגוריתמי דמיון, והשתמש במודלים כמו BERT ו־GPT-2 כדי לסנן טקסטים ירודים ולהסיר תכנים בלתי הולמים.

איך טוענים

המאגר שוקל כארבע מאות ושמונים גיגה בייט כשהוא מכווץ, ונפרס לכטרה בייט של נתונים לא דחוסים. הוא מחולק למאה שמונים ותשעה קובצי jsonl.gz ואין צורך באישור גישה מיוחד כדי להוריד אותו ישירות מהעמוד או מקישור הענן של צ'יינה טלקום. המבנה מינימליסטי לחלוטין. בכל שורה יש מפתח יחיד בשם data שמכיל את מחרוזת הטקסט המעובדת לאימון.

from datasets import load_dataset

ds = load_dataset("Tele-AI/TeleChat-PTD")

הרישיון

בדף המאגר מוגדר רישיון Apache 2.0 שמתיר שימוש מסחרי חופשי, אך הטקסט הרשמי וקובץ ה־PDF המצורף דורשים הסכם קהילתי נפרד. שימוש מסחרי במודל שנגזר ממנו מחייב הגשת בקשה ואישור במייל מול צ'יינה טלקום. הסתירה הזו מחייבת זהירות משפטית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗