GPT
F

finewiki

קוד פתוח

HuggingFaceFWcc-by-sa-4.0,gfdl2025-10-13

המאגר מרכז ערכי ויקיפדיה במאות שפות בפורמט קבצים אחיד. הוא מתאים למי שבונה אימון שפתי מקדים וזקוק לחלוקה מסודרת לפי שפה בלי לגרד דאמפים גולמיים בעצמו.

  • 7,725הורדות בחודש
  • 319לייקים

מה זה

המאגר כולל טקסטים שנאספו ממהדורות ויקיפדיה השונות ומיועדים למשימות יצירת טקסט. המידע מחולק לתצורות נפרדות לפי קוד השפה של כל ויקיפדיה, כאשר ברירת המחדל מוגדרת לשפה האנגלית. הכרטיס אינו מפרט את הליך הסינון, הניקוי או העיבוד שבוצעו על הטקסט המקורי של ויקיפדיה, ולא מציין אם הוסרו תבניות, הערות שוליים או קישורים פנימיים.

המבנה הפנימי מארגן כל שפה בנפרד תחת תיקיית נתונים ייעודית, למשל קובצי עברית תחת hewiki וערבית תחת arwiki. כל תצורה כזו מחזיקה חלוקת אימון בלבד, בלי חלוקות בדיקה או ולידציה מובנות. בסך הכל המאגר מחזיק 417 קבצים, והוא מכיל מגוון רחב מאוד של שפות מרכזיות לצד ניבים מקומיים ושפות נדירות.

מתאים ל

  • אימון שפתי מקדים

    לימוד מודלים לייצר טקסט במאות שפות שונות מתוך מאגרי ידע כלליים.

  • אימון מודלים בעברית

    שליפת התצורה של ויקיפדיה העברית לאימון טוקנייזר או מודל שפה מקומי.

  • בניית מאגרים לשפות נדירות

    חילוץ נתוני טקסט כתובים עבור ניבים ושפות עם מעט מקורות זמינים ברשת.

איפה זה נופל

כרטיס התיעוד דל מאוד ולא מדווח על תאריך החיתוך של ויקיפדיה או על סינון תוכן זדוני וטעויות. הנתונים סובלים מההטיות המובנות של כותבי ויקיפדיה, ללא בדיקת עובדות נוספת מצד המפרסם. אין במאגר חלוקה מובנית למבחן, כך שתצטרכו להפריד נתונים בעצמכם.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל דרישת שיתוף זהה קפדנית. עליכם לתת ייחוס מתאים ולשחרר תוצרים נגזרים תחת תנאים זהים, מה שעלול לחייב שחרור של המודל המאומן.

האם הדאטהסט כולל ערכים בעברית?

כן, קיימת תצורה ייעודית בשם he שמושכת את הנתונים מתיקיית hewiki. ניתן לטעון אותה בנפרד בלי להוריד את שאר השפות במאגר.

מה גודל המאגר וכמה הוא שוקל?

הכרטיס אינו מפרט את נפח האחסון הכולל בג'יגה בייט או את סך השורות. ידוע רק שהמאגר מורכב מ־417 קבצים בפורמט פרקט שמחולקים לפי השפות השונות.

איך המידע נאסף ועובד?

המקור הוא אתרי ויקיפדיה הרשמיים לפי החלוקה לשפות. מעבר לכך המפרסם לא צירף תיעוד על אופן החילוץ, הסינון או ניקוי התוכן מתוך הדאמפים המקוריים.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטים באמצעות ציון שם המאגר והשפה המבוקשת בתור קונפיגורציה. אין צורך לבקש אישור גישה מוקדם או להמתין למפתח, המאגר פתוח לחלוטין להורדה ישירה. הנתונים מאוחסנים בפורמט פרקט דחוס ויעיל, המחולק לקבצים כמו 000_00000.parquet בתוך התיקייה של כל שפה. כרטיס המאגר לא מפרט את שמות העמודות המדויקים, ולכן מומלץ לקרוא שורה ראשונה כדי לבדוק אם הטקסט מופיע תחת עמודת טקסט רגילה לצד כותרת.

from datasets import load_dataset

ds = load_dataset("HuggingFaceFW/finewiki")

הרישיון

המאגר מופץ תחת רישיונות כפולים של cc-by-sa-4.0 ו־gfdl. שימוש מסחרי מותר, אך מחייב מתן קרדיט ושיתוף יצירות נגזרות תחת אותו הרישיון בדיוק. אם תאמנו מודל על הטקסטים, ייתכן שתחול עליכם חובה לפתוח את המשקולות ברישיון זהה.

הרישיון המלא ב־Hugging Face ↗