GPT
T

two-million-bluesky-posts

קוד פתוח

alpindaleapache-2.02024-11-27

  • bluesky

שני מיליון פוסטים ציבוריים שנמשכו ישירות מהפידהוז של בלוסקיי בנובמבר 2024. חבילה נוחה למי שצריך דאטה של רשת חברתית עדכנית בלי להסתבך עם סקרייפינג עצמאי.

  • 1,792הורדות בחודש
  • 206לייקים

מה זה

המאגר כולל פוסטים שנאספו דרך ה־firehose API של Bluesky Social. כל רשומה כוללת את תוכן הטקסט, חותמת זמן של היצירה, שם המשתמש של הכותב, מזהה ייחודי של הפוסט, אינדיקציה בוליאנית האם הפוסט מכיל תמונות, וקישור לפוסט האב אם מדובר בתגובה.

יש כאן שתי תצורות שונות. הראשונה מגיעה עם שדות הבסיס בלבד. השנייה כוללת את אותם הנתונים בדיוק, אבל מוסיפה חיזוי שפה וציון ביטחון לזיהוי, שחושבו באמצעות המודל glotlid דרך ספריית fasttext. המידע מחולק לקובצי jsonl לפי זמני הדגימה, ללא סינון תוכן מדווח מעבר למה שעבר בצינור הציבורי באותם רגעים.

מתאים ל

  • אימון מודלי שפה

    הזנת תוכן חברתי מודרני למודלים, כולל סלנג ודפוסי כתיבה עכשוויים מהרשת.

  • חקר מבנה שיחות

    מיפוי שרשורים ודפוסי תגובות באמצעות שדה הקישור לפוסט המקור.

  • מחקר ניטור תוכן

    בדיקת אלגוריתמים לזיהוי תוכן פוגעני על מידע גולמי שלא עבר סינון מוקדם.

איפה זה נופל

יוצר המאגר לא טרח לפרט מגבלות או סיכונים ומסתפק בהערה שהמטרה היא ליהנות. הנתונים מייצגים חלון זמן צר מאוד מסוף נובמבר 2024, כך שאין כאן עומק היסטורי. בנוסף, רוב הטקסט באנגלית, לא נעשה שום ניקוי של ספאם, בוטים, או תוכן פוגעני, ותצטרכו לבדוק בעצמכם כמה עברית קיימת בפועל לפני שאתם בונים על זה אימון.

שאלות
נפוצות

האם מותר להשתמש בזה למוצר מסחרי?

הרישיון המדווח ברמת המאגר הוא Apache 2.0 שמתיר שימוש מסחרי. יחד עם זאת, התיעוד מחייב עמידה בתנאי השימוש של Bluesky עצמה. כדאי לוודא שהתנאים שלהם לא מגבילים את הפעילות הספציפית שאתם מתכננים.

האם הדאטהסט כולל עברית?

המאגר מוגדר כבעל שפות מרובות אבל בעיקר אנגלית, ואין הבטחה לכמות מסוימת של עברית. אם אתם מחפשים טקסט מקומי, תצטרכו להשתמש בתצורה שכוללת את זיהוי השפות של glotlid ולסנן לפיה.

איך הנתונים נאספו?

הפוסטים נמשכו ישירות מהפידהוז הציבורי של רשת Bluesky בנקודת זמן ספציפית בנובמבר 2024. הם לא עברו סינון ידני או עריכה, ומכילים בדיוק את מה שזרם ברשת באותם רגעים.

איך טוענים

הנתונים יושבים בפורמט jsonl שמחולק לכעשרים וחמישה קבצים, כך שקל להזרים אותם ישירות עם ספריית datasets בלי להוריד הכל בבת אחת. אין כאן צורך באישור גישה או בטופס מקדים. אם אתם עובדים על סינון לפי שפה, התצורה עם התחזיות חוסכת ריצה עצמאית של מודל זיהוי, והשדה reply_to מאפשר לשחזר שרשורים בקלות יחסית.

from datasets import load_dataset

ds = load_dataset("alpindale/two-million-bluesky-posts")

הרישיון

הרישיון המוגדר במערכת הוא apache-2.0, שמאפשר שימוש חופשי וגם מסחרי בלי לכפות פתיחה של קוד המודל שלכם. עם זאת, היוצר מציין במפורש שהשימוש כפוף לתנאי השירות של Bluesky. צריך לקחת בחשבון את המדיניות של הרשת עצמה לגבי דאטה ציבורי של משתמשים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗