GPT
T

twitter-financial-news-sentiment

קוד פתוח

zeroshotmit2022-09-01

  • twitter
  • finance
  • markets
  • stocks
  • wallstreet

המאגר מרכז ציוצי פיננסים באנגלית שמתוייגים לפי סנטימנט שוק. הוא מתאים למי שרוצה לאמן או לבדוק מודל סיווג על שיח מסחר אמיתי וקצר.

  • 4,144הורדות בחודש
  • 179לייקים

מה זה

הנתונים כוללים 11,932 ציוצים באנגלית שנאספו ישירות דרך ה־API של טוויטר. כל רשומה מתוייגת לאחת משלוש קטגוריות סנטימנט מוגדרות: שורי (Bullish), דובי (Bearish), או ניטרלי (Neutral). המטרה כאן היא משימת סיווג טקסט רב מחלקתי המותאם לזיהוי כיווניות שוק מתוך כתיבה חופשית ברשת.

הקובץ מחולק מראש לשני חלקים בלבד, אימון ואימות. סט האימון מכיל 9,938 דוגמאות, וסט האימות כולל 2,486 ציוצים. המפרסמים לא פירטו בכרטיס את מילות החיפוש המדויקות ששימשו לשליפה, אילו חשבונות נדגמו, או מי האנשים שביצעו את התיוג בפועל.

מתאים ל

  • סיווג ציוצים פיננסיים

    אימון מסווג שמזהה אם פוסט קצר בשוק ההון מביע מגמה חיובית, שלילית או ניטרלית.

  • הערכת מודלי שפה

    בדיקת ביצועים של מודלים קיימים מול סלנג וקיצורים הנפוצים בקהילות סוחרים.

  • סינון רעש באלגוטריידינג

    רכיב ראשוני לסינון פוסטים ניטרליים לפני העברת מידע בעל כיוון לאלגוריתם מסחר.

איפה זה נופל

המאגר מוגבל לאנגלית בלבד, כך שהוא לא יעזור לניתוח שוק מקומי בעברית או בבורסה בתל אביב. הוא פורסם בספטמבר 2022, והכרטיס לא מציין מתי בדיוק הציוצים נאספו. סלנג פיננסי בטוויטר משתנה מהר, וציוצים ישנים עלולים להחמיץ מונחים עכשוויים. מעבר לכך, אין שום פירוט על מתודולוגיית התיוג או בקרת האיכות, ולכן כדאי לדגום ידנית כמה עשרות שורות כדי לוודא שהתיוגים סבירים לפני שבונים על זה מערכת מסחר.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט במוצר מסחרי?

כן. הרישיון המדווח הוא MIT, שמתיר שימוש מסחרי חופשי, שינוי ושילוב במוצרים סגורים. יש לשמור רק על תנאי הייחוס של הרישיון.

האם יש במאגר ציוצים בעברית?

לא. הנתונים כוללים טקסטים באנגלית בלבד שנאספו מטוויטר, ללא תמיכה בשפות נוספות.

איך הנתונים נאספו ותויגו?

לפי הכרטיס, המידע נאסף באמצעות ה־API של טוויטר וסווג לשלוש תוויות. מעבר לכך, המפרסמים לא פירטו מי תייג את הטקסטים או באילו קריטריונים השתמשו.

כמה מקום המאגר תופס והאם צריך מחשב חזק?

המאגר כולל פחות מ־12 אלף רשומות השמורות בקובצי CSV קטנים. אפשר להוריד אותו בשניות ולעבוד איתו על כל מחשב נייד בסיסי בלי שום חומרה מיוחדת.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם המזהה zeroshot/twitter-financial-news-sentiment בלי צורך באישור גישה מיוחד. המאגר מכיל חמישה קבצים, כשהנתונים עצמם יושבים בקובצי CSV פשוטים בשם sent_train.csv ו־sent_valid.csv לצד קובץ מטא-דאטה. הגודל הכולל זעיר ביחס למקובל בתחום ועומד על קצת יותר מעשרת אלפים שורות, כך שההורדה והאימון רצים מקומית תוך דקות ספורות בלי לדרוש משאבי מחשוב כבדים או כרטיסי מסך יקרים. השדות החשובים לעבודה הם טקסט הציוץ ותווית הסנטימנט המספרית.

from datasets import load_dataset

ds = load_dataset("zeroshot/twitter-financial-news-sentiment")

הרישיון

המאגר שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו בקוד סגור ולאמן עליו מודלים מסחריים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים. אין חובה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗