GPT
T

TxT360-v2

קוד פתוח

IFMcc-by-4.02026-08-24

  • k2-horizon
  • training-data
  • parquet
  • web

מאגר טקסטים מהרשת ומערכי שאלות ותשובות שמיועד לאימון מקדים של מודלי שפה. הוא מרכז נתונים שעברו סינון ועיבוד כחלק מפרויקט K2 Horizon הרחב.

  • 1,740הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל רשומות טקסט שמקורן ברשת ובתוכן של שאלות ותשובות, אשר נועדו לאימון מודלים גנרטיביים. במקור המידע נאסף ונשמר במבנה של אובייקטי JSON, ולאחר מכן הומר לקבצי Parquet מחולקים כדי לאפשר עבודה נוחה וקריאה מקבילית של קטעי מידע.

המבנה מחולק לשלושה תתי מאגרים נפרדים, כשלכל אחד מהם יש רק פיצול אימון יחיד. החלק הראשון נקרא web-high-nltk-qa ומרכז טקסט רשת לצד שאלות ותשובות, החלק השני נקרא web-high-medium ומתמקד בתוכן רשת באיכויות שונות, והחלק השלישי הוא txt360-qa שמתמקד כולו בפורמט של שאלות ותשובות. תהליכי העיבוד והניקוי נעשו ברמת כל תת מאגר בנפרד, וכללו סינון לפי מקורות, ניקוי רעשים, הסרת כפילויות, דירוגי איכות מסוימים ובחלק מהמקרים גם יצירת נתונים סינתטיים לפי הכרטיס.

שמות השדות והמבנה הפנימי של הרשומות אינם זהים בין תתי המאגרים השונים. בגלל שהנתונים הגיעו ממקורות שונים עם מאפיינים שונים, יש לבדוק את הגדרת המאפיינים בכל תת מאגר לפני שמתחילים לבנות צינור עיבוד מלא.

מתאים ל

  • אימון מקדים של מודלים

    שימוש בקובצי הטקסט לצורך אימון של מודלי שפה גדולים על טקסט כללי ושאלות מהרשת.

  • אימון משימות מענה לשאלות

    שליפת תת המאגר הממוקד בשאלות ותשובות כדי לשפר את הדיוק של מודל במתן מענה ענייני.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של נתונים שעברו סינון ויצירה סינתטית על ביצועי השפה בהשוואה לטקסט גולמי.

איפה זה נופל

בכרטיס מצוין בבירור שהטקסטים כוללים שגיאות עובדתיות, כפילויות שלא סוננו, נושאים רגישים, סטריאוטיפים ותכנים לא בטוחים. המפרסמים לא מפרטים אילו שפות קיימות בפנים, כך שאין שום הבטחה לנוכחות של עברית או לאיכותה. בנוסף, חלוקת השדות אינה אחידה, מה שעלול לשבור צינורות עיבוד אוטומטיים. אם אתם בונים מערכת שפונה למשתמשי קצה, אי אפשר להסתמך על הסינון המקורי של המאגר ויש לבצע סינון סיכונים ובדיקות בטיחות עצמאיות.

אותה משפחה

TxT360 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי חופשי לחלוטין. התנאי היחיד שהרישיון דורש הוא מתן ייחוס וקרדיט הולם ליוצרים של המאגר. אין דרישה לפתוח את קוד המודל שלכם או לשתף אותו תחת אותו הרישיון.

האם המאגר כולל תוכן בעברית?

כרטיס המאגר לא מציין רשימת שפות ולא מפרט אם קיימת עברית בטקסטים שנאספו. התיעוד מתמקד בטקסט כללי מהרשת ובשאלות ותשובות, בעיקר בהקשר של פרויקט K2 Horizon. אם אתם צריכים אימון בעברית, תצטרכו לדגום את הרשומות באמצעות הזרמה ולבדוק את השפות בפועל לפני ההורדה.

איך בנויים הקבצים וכמה מקום צריך?

המאגר מורכב מ־2,638 קבצים בפורמט Parquet המחולקים לשלושה תתי מאגרים נפרדים. גודל הנפח הכולל בדיסק לא צוין במפורש בכרטיס המאגר. מומלץ להשתמש ביכולת ההזרמה של הספרייה כדי לקרוא את הנתונים ישירות בלי להוריד את כל המאגר למחשב המקומי.

איזה עיבוד מקדים עבר הטקסט לפני הפרסום?

לפי התיעוד, כל תת מאגר עבר תהליכי ניקוי ייעודיים שכללו סינון לפי מקור, הסרת כפילויות, חישוב מדדי איכות ובחלק מהמקרים גם יצירת נתונים סינתטיים. יחד עם זאת, המפרסמים מציינים שעדיין קיימים תכנים משוכפלים, שגיאות עובדתיות וטקסטים לא בטוחים. האחריות על בדיקות התאמה וסינון נוסף מוטלת על מי שמאמן את המודל.

איך טוענים

טוענים את המידע ישירות בעזרת הספרייה של Hugging Face דרך הפקודה load_dataset עם ציון שם המאגר ותת המאגר הספציפי שרוצים. בגלל שמדובר באלפי קבצי Parquet שמחולקים לחלקים קטנים, מומלץ מאוד להפעיל מצב הזרמה כדי להתחיל לעבוד בלי להוריד את כל המאגר מראש. אין צורך באישור גישה מיוחד, המאגר פתוח לכולם. לפני שרצים על הכל, חובה להדפיס את השדות של הדגימה הראשונה כדי להבין מה שמות העמודות בתת המאגר שבחרתם, כי המבנה משתנה בין התצורות השונות.

from datasets import load_dataset

ds = load_dataset("IFM/TxT360-v2")

הרישיון

המאגר מופץ ברישיון ייחוס בינלאומי מסוג CC BY 4.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת שלהם, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים של המאגר. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו הרישיון, מה שמשאיר חופש פעולה רחב בבניית מוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗