GPT
V

vietnamese_curated_dataset

קוד פתוח

VTSNLPרישיון לא דווח2024-09-26

מאגר טקסטים רחב בוייטנאמית שעבר סינון קפדני. הוא מיועד למי שצריך לאמן מודלים שפתיים על דאטה נקי במקום להתעסק בעצמו עם גרידות רשת מלוכלכות.

  • 843הורדות בחודש
  • 76לייקים

מה זה

המאגר מורכב מארבעה מקורות תוכן מוכרים בוייטנאמית: החלק הוייטנאמי של C4, גרסת 23.01 של קורפוס OSCAR, ערכים מויקיפדיה הוייטנאמית מדצמבר 2023, ואוסף כתבות חדשות בשם binhvq news. כל המקורות האלה מוזגו לקורפוס טקסטואלי אחד במטרה ליצור כיסוי רחב של השפה.

צוות הפיתוח העביר את כל החומר דרך NeMo Curator של NVIDIA. העיבוד כלל חמישה שלבים עיקריים: האחדת קידודי יוניקוד למניעת בעיות טקסט, הסרת כפילויות מדויקות, סינון איכות, הפעלת חוקים היוריסטיים להעפת זבל, ושימוש במסווג מבוסס למידת מכונה שסינן מסמכים באיכות נמוכה. התוצאה היא טקסט מוכן לקריאה וללמידה בלי שכפולים ברורים ובלי רעשי רשת קיצוניים.

מתאים ל

  • אימון מודלי שפה

    בסיס טקסטואלי נקי וגדול לאימון מקדים של מודלי שפה ייעודיים לוייטנאמית.

  • הערכת ביצועים

    בדיקת יכולות יצירת טקסט והבנה של מודלים קיימים מול קורפוס מסונן היטב.

  • התאמת תחום

    כוונון עדין של מודלים רב לשוניים כדי לחזק את השליטה שלהם בוייטנאמית.

איפה זה נופל

המאגר כולל טקסט בוייטנאמית בלבד, ואין בו שום ייצוג לעברית או לשפות אחרות. הנתונים מבוססים על גרסאות ישנות יחסית של מקורות הרשת, כמו ויקיפדיה מסוף 2023 ו־OSCAR מראשית אותה שנה, כך שמידע עדכני יותר פשוט לא קיים כאן. מעבר לכך, הכרטיס לא מפרט את הכללים ההיוריסטיים הספציפיים ששימשו לסינון, ולכן קשה לדעת אילו סוגי טקסט או נושאים נחתכו בדרך בלי לבדוק את הדגימות בעצמכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון של המאגר לא דווח כלל על ידי המפתחים. ללא תנאי רישוי ברורים, ברירת המחדל היא שאין לכם אישור משפטי להשתמש במידע הזה במוצרים מסחריים. אם אתם בונים כלי לעסק, תצטרכו לפנות ליוצרים ישירות כדי לברר את הנושא.

האם המאגר כולל טקסטים בעברית?

לא, המאגר כולל אך ורק טקסט בשפה הוייטנאמית. כל המקורות שנאספו אליו, מוויקיפדיה ועד מאגרי חדשות, סוננו ספציפית עבור השפה הזו. לפרויקטים שדורשים עברית הוא אינו רלוונטי.

איך הדאטהסט הזה נאסף ועובד?

החומר הגיע משילוב של ארבעה מקורות קיימים בוייטנאמית: C4, OSCAR, ויקיפדיה ומאגר חדשות מקומי. לאחר האיסוף, הצוות העביר אותו שרשרת סינון בעזרת כלי הניקוי NeMo Curator. התהליך כלל נירמול יוניקוד, הסרת כפילויות, וסינון טקסטים ירודים בעזרת כללים ומודל סיווג ייעודי.

במה הוא שונה מדאטהסטים וייטנאמיים פתוחים אחרים?

במקום לתת לכם עוד גרידה גולמית ורועשת של האינטרנט, המאגר הזה מתמקד בניקוי עמוק. היוצרים חיברו כמה מאגרים פתוחים מוכרים והשקיעו בעיבוד המוקדם באמצעות מודלים ומסננים של NVIDIA. בזכות זה מקבלים קורפוס הרבה יותר איכותי מאשר הורדה ישירה של מקורות כמו OSCAR.

איך טוענים

הדאטהסט מחולק ל־133 קובצי Parquet שונים תחת תיקיית data, לצד קובץ התיעוד, עם 134 קבצים בסך הכל במאגר. אין צורך בבקשת גישה מיוחדת, הוא פתוח להורדה ישירה דרך ספריית datasets הרגילה. בגלל כמות הקבצים הגדולה, כדאי לטעון אותו בעזרת הזרמה או להוריד מקטעים בודדים לבדיקה ראשונית לפני שמורידים את כל החבילה לדיסק המקומי.

from datasets import load_dataset

ds = load_dataset("VTSNLP/vietnamese_curated_dataset")

הרישיון

היוצרים לא דיווחו על רישיון רשמי בעמוד המאגר. המשמעות פשוטה: אין לכם היתר שימוש מוגדר, ואי אפשר לדעת אם מותר להשתמש בו לצרכים מסחריים, איך יש לתת ייחוס, או מה המגבלות על מודל שתאמנו עליו. שימוש עסקי במצב כזה הוא סיכון משפטי שכדאי להימנע ממנו.

הרישיון המלא ב־Hugging Face ↗