GPT
A

arctic

קוד פתוח

open-indexother2026-03-14

  • reddit
  • social-media
  • arctic-shift
  • pushshift
  • comments

המאגר מאגד את כל התגובות והפוסטים הציבוריים מרדיט מ־2005 עד תחילת 2026 בקבצי פארקט חודשיים. הוא מיועד למי שצריך היקף עצום של שיחות טבעיות לאימון מודלים בלי לחפש גיבויים ישנים בטורנטים.

  • 25,467הורדות בחודש
  • 29לייקים

מה זה

הנתונים מבוססים על פרויקט Arctic Shift, שסרק ושמר את רדיט לאורך השנים, והומרו כאן למבנה פארקט מסודר. המאגר מכיל 15.7 מיליארד פריטים, מתוכם 12.9 מיליארד תגובות ו־2.8 מיליארד פוסטים מכל קהילה ציבורית שנפתחה אי פעם ברשת. הכרטיס לא מציין סינון של תוכן פוגעני, ספאם או הסרת רעלים, כך שהטקסט מופיע כפי שנכתב במקור על ידי המשתמשים ברשת.

החלוקה הפנימית מפרידה לחלוטין בין שני סוגי התוכן: תיקיית תגובות ותיקיית פוסטים. כל אחת מהן מחולקת לפי שנים וחודשים, כאשר חודשים עמוסים משנת 2015 ואילך מפוצלים למספר קבצים של כ־200 מגה כדי לא לחנוק את הזיכרון בעבודה שוטפת. לצד קובצי המידע נמצאים קובצי מעקב שמפרטים גדלי דחיסה, זמני עיבוד ומספרי שורות לכל חודש שנכנס למאגר.

מתאים ל

  • אימון מקדים של מודלי שפה

    טקסט שיחתי בהיקף של מיליארדי שורות באנגלית עבור למידת סגנון טבעי ומבנה דיאלוג.

  • ניתוח סנטימנט והתנהגות

    מעקב אחרי שינויי דעות וטרנדים בקהילות מוגדרות לאורך עשרים שנות פעילות.

  • איחזור מידע מבוסס קהילה

    בניית אינדקס לשאלות ותשובות טכניות מתוך פורומים של תכנות ותחביבים.

איפה זה נופל

המידע מוגבל לאנגלית כמעט בלבד, כך שלאימון מודלים בעברית הוא אינו רלוונטי כלל. המאגר משקף את כל ההטיות והרעלים של רדיט ללא סינון מוקדם, כולל חשבונות מחוקים וספאם. בנוסף, רדיט שינתה תנאי שימוש סביב גישה לנתונים בשנים האחרונות, ומכיוון שמדובר בשמירה גולמית בלי ניקוי פרטיות, שימוש ישיר במוצר מסחרי עלול לייצר חשיפה משפטית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מוגדר כאחר ולא כרישיון פתוח חופשי, והתוכן שייך במקור לרדיט ולמשתמשים שלה. שימוש מסחרי במודל שאומן על המידע הזה חושף אתכם לתביעות על הפרת זכויות יוצרים ותנאי השימוש של רדיט. לחברות מסחריות מומלץ להתייעץ עם עורך דין לפני שנוגעים בקבצים.

כמה שוקל כל הדאטהסט והאם חייבים להוריד הכל?

המשקל הכולל בפורמט פארקט דחוס עומד על 1.3 טרה-בייט, מתוכם 1.0 טרה לתגובות ו־326.6 ג'יגה לפוסטים. אין שום צורך להוריד את כולו. המבנה החודשי מאפשר להזרים שורות בודדות או לשלוף רק שנים וסאברדיטים ספציפיים בעזרת שאילתות ישירות.

האם יש בדאטהסט תוכן בעברית?

שפת המאגר המוגדרת היא אנגלית בלבד. יכול להיות שתמצאו פה ושם הודעות בודדות מסאברדיטים ישראליים, אבל זה זניח לחלוטין ולא מתאים לבניית מודל שפה בעברית.

איך המידע נאסף והאם הוא עבר ניקוי?

הנתונים מגיעים מארכיון Arctic Shift ששמר גיבויים של רדיט החל מסוף 2005. לא נעשה כאן סינון איכות, הסרת רעלים או ניקוי שמות משתמשים מחוקים, אלא רק המרה טכנית של קובצי ארכיון לפארקט.

איך טוענים

טוענים את המידע ישירות באמצעות דאק די-בי בלי להוריד את כל 1.3 הטרה-בייט למחשב, או דרך ספריית דאטהסטס עם סטרימינג פעיל. הגישה חופשית ואינה דורשת אישור, אך מי שרוצה להוריד מקומית חודש מסוים צריך להשתמש בפילטרים לפי שנה וחודש. השדות המרכזיים כוללים את שם המחבר, שם הסאברדיט, גוף הטקסט, שעת היצירה והניקוד שקיבל הפריט.

from datasets import load_dataset

ds = load_dataset("open-index/arctic")

הרישיון

הרישיון מוגדר כאחר. המפרסמים לא הצמידו רישיון קוד פתוח סטנדרטי כמו אפאצ'י או אם-איי-טי, והתוכן עצמו שייך למשתמשי רדיט ולפלטפורמה. המשמעות היא שאין היתר מסחרי מפורש, וכל אימון של מודל מסחרי על בסיס החומר הזה מלווה בסיכון משפטי ברור.

הרישיון המלא ב־Hugging Face ↗