GPT
H

high-quality-english-sentences

קוד פתוח

agentlansodc-by2024-10-01

מאגר שמציע משפטים קריאים באנגלית שסוננו מרעשי רשת. המטרה כאן היא לתת טקסט נקי מספאם לאימון מודלים בסיסיים בלי שתצטרכו לנקות דאטה גולמי בעצמכם.

  • 1,800הורדות בחודש
  • 38לייקים

מה זה

המאגר כולל משפטי טקסט רגילים באנגלית, שורה אחת לכל משפט, ללא שדות מטא נוספים. המקורות הם מיליון משפטים שנלקחו מתוך C4 ועוד מיליון משפטים מתוך FineWeb, בכוונה לא מגרסת ה Edu, כדי לפתוח את התוכן למגוון רחב יותר של נושאים.

תהליך הניקוי כלל הרצה של מסווג איכות מבוסס DeBERTa וסינון של כל מה שקיבל ציון נמוך מחצי או שהיה קצר מ 20 תווים. לאחר מכן נמחקו משפטים שלא התחילו באות גדולה, משפטים עם סוגריים לא סגורים וכפילויות זהות. התוצאה חולקה לעשרים אחוז סט בדיקה שמכיל 170,522 משפטים, ותשעים אחוז סט אימון עם 1,534,699 משפטים, סך הכל 1,705,221 רשומות.

מתאים ל

  • אימון מודלי שפה קטנים

    הזנת טקסט אנגלי נקי מספאם למודלים שצריכים ללמוד מבנה שפה בסיסי בלי רעשי אינטרנט.

  • מדידת דמיון בין משפטים

    בניית מאגר ייחוס של משפטים תקינים לצורך בדיקת קרבה וקטורית או משימות סיווג.

  • חילוץ מאפיינים וייצוגים

    יצירת אמבדינגס לטקסט כללי באנגלית שמתבסס על מקורות רשת מסוננים.

איפה זה נופל

הסינון לא יוצר טקסט מושלם. יש עדיין שגיאות כתיב ודקדוק, וכותרות או ציטוטים נספרו לפעמים כמשפט שלם. הדרישה לאות גדולה בתחילת שורה העיפה החוצה רשימות מועילות והטתה את התוכן לסגנון רשמי מדי. המאגר מוגבל אך ורק לאנגלית, ולמרות הניסיון לברוח מ FineWeb-Edu, הנתונים עדיין נוטים לכיוון אקדמי וחינוכי. אם אתם צריכים סלנג או שיחות יומיומיות, זה לא המקום.

שאלות
נפוצות

האם יש במאגר משפטים בעברית?

לא. המאגר מוגדר ומכיל אך ורק משפטים באנגלית. אין בו תמיכה בשפות אחרות.

מותר להשתמש בו במוצר מסחרי?

כן, רישיון ODC-By מתיר שימוש מסחרי מלא. אתם רק חייבים לתת קרדיט למפרסם המאגר בהתאם לתנאי הרישיון.

האם הטקסטים עברו הגהה לשונית מלאה?

לא. הסינון התמקד בהסרת ספאם ווידוא קריאות בסיסית, כך שעדיין יש בפנים שגיאות כתיב ודקדוק. בנוסף, נכללו בו כותרות וקטעי ציטוט שאינם בהכרח משפטים תקניים.

איך המאגר הזה שונה מ FineWeb הרגיל?

הוא לוקח דגימה משולבת של C4 ו FineWeb, ומפעיל עליה פילטר איכות אוטומטי, ניקוי פיסוק והסרת כפילויות. במקום טרה בייטים של דפי אינטרנט גולמיים, מקבלים קובץ טקסט עם כ 1.7 מיליון משפטים בודדים.

איך טוענים

אין צורך לבקש אישור גישה מיוחד. המאגר מכיל ארבעה קבצים, כשהנתונים עצמם שמורים כקבצי טקסט דחוסים בסיומת txt.gz עבור train ו test. כל שורה היא מחרוזת פשוטה שמייצגת משפט, כך שאין צורך להתעסק עם מבני נתונים מורכבים בטעינה. פשוט פותחים, קוראים שורה אחרי שורה ומזרימים לתהליך העבודה שלכם.

from datasets import load_dataset

ds = load_dataset("agentlans/high-quality-english-sentences")

הרישיון

המאגר מופץ תחת רישיון ODC-By. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו ולבנות עליו מודלים. התנאי היחיד הוא מתן קרדיט וייחוס מתאים למקור. אין דרישה להפיץ תוצרי המשך תחת אותו הרישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗