GPT
E

exorde-social-media-one-month-2024

קוד פתוח

Exordemit2024-12-15

  • social-media
  • multi-lingual
  • sentiment-analysis
  • emotion-detection
  • text

מאגר ענק של 269 מיליון פוסטים שנאספו ברשת במשך חודש אחד בסוף 2024, עם תיוגי רגש, נושאים וסנטימנט מובנים ל־122 שפות.

  • 3,324הורדות בחודש
  • 29לייקים

מה זה

המאגר כולל 269,403,210 רשומות שנאספו בין ה־14 בנובמבר ל־12 בדצמבר 2024 מיותר מ־5,000 מקורות ציבוריים. הרוב המוחלט של התוכן מגיע משלוש פלטפורמות עיקריות: x.com עם כ־179 מיליון פוסטים, רדיט עם כ־52 מיליון, ובלוסקיי עם כ־24 מיליון. שאר הדאטה מתפזר בין יוטיוב, 4chan, אתרי חדשות ופורומים שונים בעולם.

כל שורה כוללת את הטקסט המקורי כפי שפורסם, חותמת זמן מדויקת, קישור למקור, גיבוב של שם המשתמש לשמירה על פרטיות, וזיהוי שפה שנעשה באמצעות fasttext. בנוסף, הרשומות כוללות תיוגים שנוצרו בידי מכונה: ציון סנטימנט מספרי בין 1- ל־1, זיהוי של 26 סוגי רגשות, מילות מפתח באנגלית שהופקו ב־KeyBert, ותיוג של נושא ראשי ומשני מתוך רשימה של 16 קטגוריות באמצעות מודל DeBERTa v3.

מתאים ל

  • אימון מסווגי סנטימנט ורגש

    שימוש בטקסטים המתוייגים כדי לבנות מודלים מהירים לזיהוי רגש וסנטימנט בשיח חברתי ברשת.

  • איחזור מידע והטמעה רב-לשונית

    בניית אינדקסים למנועי חיפוש וטקסט-רטריבל מתוך מאגר שיחות רחב ב־122 שפות שונות.

  • ניתוח מגמות ואירועים ברשת

    חקר התפשטות של נושאים ואירועים גלובליים על פני פלטפורמות שונות במהלך חודש מוגדר.

איפה זה נופל

חלון הזמן מוגבל לחודש בודד בסוף 2024, כך שהטקסטים מוטים מאוד סביב אירועים אקטואליים ספציפיים לאותם ימים כמו הבחירות בארצות הברית או אירועים פוליטיים בסוריה. בנוסף, מעל 66% מהתוכן מגיע מ־x.com, ורוב מוחלט מבוסס על אנגלית עם מעל 190 מיליון רשומות, מה שמייצר הטיה ברורה באופי השיח ובמקורות. החסרון המשמעותי ביותר הוא שכל התיוגים, כולל רגשות, סנטימנט ונושאים, הם תיוגי מכונה ממודלים כמו DeBERTa ו־KeyBert. התיוגים האלה מכילים שגיאות והזיות מובנות, ולכן אסור להסתמך עליהם כעל אמת מוחלטת ללא בדיקה מדגמית ידנית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הדאטהסט מופץ תחת רישיון MIT שמאפשר שימוש מסחרי מלא, כולל אימון מודלים סגורים ושילובם במוצרים מסחריים. נדרש רק לשמור על תנאי הייחוס של הרישיון.

האם המאגר כולל עברית?

המאגר מוגדר כרב-לשוני ומכיל 122 שפות לפי זיהוי fasttext, אך עברית אינה מופיעה ברשימת עשר השפות המובילות. השפה השלטת בפער עצום היא אנגלית עם מעל 190 מיליון רשומות, כך שכמות הטקסט בעברית לא מפורטת ועשויה להיות קטנה מאוד.

איך נוצרו התיוגים של הסנטימנט והנושאים?

התיוגים נוצרו בצורה אוטומטית לחלוטין על ידי מודלים ולא על ידי בני אדם. הנושאים סווגו באמצעות מודל DeBERTa v3, הסנטימנט חושב משילוב של מודלים עמוקים, ומילות המפתח הופקו באמצעות KeyBert.

מה מבנה הקבצים ואיך הם מאוחסנים?

הנתונים מחולקים ל־543 קבצי parquet נפרדים, כאשר כל קובץ כולל בממוצע כמעט חצי מיליון שורות. מבנה זה מאפשר להוריד ולעבד חלקים מהמידע במקביל מבלי לפתוח קובץ בודד ענק.

איך טוענים

הדאטהסט פתוח להורדה ישירה ללא צורך באישור גישה. הוא מורכב מ־543 קבצי parquet, עם ממוצע של כחצי מיליון שורות לכל קובץ. בגלל ההיקף, טעינה מלאה לזיכרון של כל 269 מיליון הרשומות תדרוש משאבי אחסון וחישוב כבדים מאוד, כך שעדיף לעבוד בסטרימינג או לעבד קבצים בודדים לפי הצורך. השדות המרכזיים לעבודה הם original_text עבור הטקסט הגולמי, language לסינון שפות, ו־sentiment ו־main_emotion למשימות למידה מונחית.

from datasets import load_dataset

ds = load_dataset("Exorde/exorde-social-media-one-month-2024")

הרישיון

המאגר מפורסם תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקרי חופשי לחלוטין, כולל שינוי של המידע ואימון מודלים, ללא חובת שיתוף באותו רישיון. הדרישה היחידה היא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוצר שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗