GPT
D

danish-dynaword

קוד פתוח

danish-foundation-modelscc0-1.02024-12-15

  • text-corpus
  • continual-development
  • community-collaboration
  • synthetic-annotations

מאגר טקסטים חופשיים בדנית מודרנית והיסטורית בהיקף של כמעט עשרה מיליארד טוקנים. הוא נבנה מראש במטרה לתת בסיס חוקי ונקי לאימון מודלי שפה בלי לגרד את כל הרשת.

  • 6,820הורדות בחודש
  • 22לייקים

מה זה

המאגר מרכז 7.4 מיליון מסמכים בטקסט חופשי, שמגיעים מתמהיל רחב של מקורות ציבוריים ומוכרים בדנמרק. כל רשומה מייצגת מסמך בודד ומכילה מזהה ייחודי, את הטקסט עצמו ותיוגי איכות כמו רמת תוכן, צפיפות מידע וערך לימודי שנמדדו עבור כל פריט.

מבחינת חלוקה נושאית, החלק הארי נשען על מסמכים פרלמנטריים ומשפטיים של הפרלמנט הדני, גופי ממשל, רשויות מקומיות ובתי משפט. לצדם נכללים ספרים מספריות לאומיות ומפרויקט גוטנברג, ארכיוני חדשות, תמלילי שיחות וכתוביות, פוסטים מפורומים מקומיים וערכים מוויקיפדיה.

השליטה במאגר מתבצעת לפי תת מאגרים נפרדים שמייצגים כל מקור, כך שאפשר למשוך רק מקור מסוים או את כלל הדאטה ביחד. בנוסף קיים קונפיג ייעודי שמספק את המטא דאטה והתיוגים לצורך סינון מקדים של רשומות חלשות.

מתאים ל

  • אימון מודלי שפה בדנית

    בסיס רחב לאימון מקדים של מודלים גנרטיביים שצריכים להבין דנית היטב.

  • ניתוח מסמכים משפטיים

    התאמת מודלים לניתוח שפה ממשלתית ומשפטית מורכבת בזכות מיליארדי טוקנים רלוונטיים.

  • מחקר בלשנות והיסטוריה

    מעקב אחר התפתחות השפה הדנית באמצעות שילוב בין דיאלקטים וטקסטים היסטוריים.

איפה זה נופל

אם אתם בונים מערכת שמיועדת לדנית יומיומית מודרנית, צפויה לכם בעיה. כמחצית מהטוקנים מגיעים ממסמכים בירוקרטיים, שפה משפטית ותיעוד פרלמנטרי יבש. בנוסף, נכללים טקסטים היסטוריים וספרות ישנה שכוללים איות ארכאי, וכן דיאלקטים מקומיים כמו בורנהולמסק. הכרטיס מציין גם נוכחות של אנגלית עקב מעבר בין שפות, וזליגה של נורווגית בגלל טעויות בסיווג שפה. חסר פה ייצוג שווה של שפה מדוברת עכשווית או שיחות רשת יומיומיות, ויש צורך ממשי לסנן טקסטים באמצעות קובצי התיוג לפני שדוחפים אותם לאימון.

שאלות
נפוצות

האם המאגר הזה מתאים לשימוש בפרויקט מסחרי סגור?

לא בכללותו ובלי סינון. חלק גדול מהטקסטים, בהיקף של כ 2.6 מיליארד טוקנים, מוגן ברישיון CC BY-SA שמחייב שיתוף זהה. אם תאמנו מודל מסחרי על כל המאגר, אתם מסתכנים בחובת שחרור פתוחה. כדי לעבוד מסחרית בבטחה, תצטרכו להגדיר סינון ולטעון רק את התת מאגרים שתחת CC0 או רישיונות מתירניים מתאימים.

האם יש במאגר הזה טקסטים בעברית?

לא, אין בו תוכן בעברית כלל. המאגר מיועד ספציפית לשפה הדנית ולדיאלקטים שלה. הוא מכיל מעט אנגלית ונורווגית שנכנסו עקב שגיאות סיווג או ערבוב שפות במקור, אבל אין בו נתונים רלוונטיים לעיבוד שפה טבעית בעברית.

איך אפשר לוודא שהקוד לא מוריד נתונים באיכות נמוכה?

היוצרים בנו קונפיג מטא דאטה נפרד בשם meta שמכיל תיוגים לכל מסמך. הנתונים האלה כוללים הערכות איכות, ערך חינוכי וצפיפות מידע. אפשר לקרוא את קובץ המטא, לסנן מסמכים שקיבלו ציונים ירודים או כאלה שלא עומדים בסף מסוים, ורק אז להזין את הטקסטים לתהליך האימון.

כמה גדול המאגר ומה ההבדל בין המספרים שמוצגים בו?

המאגר כולל 7.40 מיליון דגימות טקסט בסך הכל. לפי טוקנייזר של Llama 3, כלל הטקסט מיתרגם ל 9.81 מיליארד טוקנים. אורך המסמכים משתנה מאוד, החל ממשפטים קצרים של שני טוקנים ועד למסמכי ענק של מיליוני טוקנים, כאשר הממוצע עומד על כ 1.33K טוקנים למסמך.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets באמצעות הנתיב danish-foundation-models/danish-dynaword לתוך פיצול train. אין צורך לבקש אישור גישה מוקדם, והמאגר פתוח להורדה. בגלל הגודל העצום של הנתונים, שכולל קובצי Parquet רבים וקרוב לעשרה מיליארד טוקנים, מומלץ לעבוד עם הזרמת נתונים streaming שמונעת עומס על הזיכרון. אפשר גם למשוך תת מאגר ספציפי לפי שם המקור שלו. השדות המרכזיים בטעינה הם מזהה הטקסט id ומחרוזת התוכן text, וכדאי לקבע את מספר ה revision כדי לעבוד מול גרסה יציבה שלא תשתנה עם עדכוני המאגר.

from datasets import load_dataset

ds = load_dataset("danish-foundation-models/danish-dynaword")

הרישיון

האוסף עצמו מוגדר תחת CC0, אבל הטקסטים בפנים מחולקים לפי מקורות שונים. מעל רבע מהמידע דורש ייחוס בלבד (CC BY 4.0), נתח משמעותי נוסף נתון תחת רישיון CC BY-SA 4.0, וישנם מקורות נוספים ללא הגבלת ייחוס. רישיון שיתוף זהה עלול לחייב אתכם לחשוף מודל שתאמנו על החלקים האלה, לכן חובה לסנן את המקורות לפי רישיון לפני שמשלבים אותם במוצר מסחרי סגור.

הרישיון המלא ב־Hugging Face ↗