GPT
T

twitter-financial-news-topic

קוד פתוח

zeroshotmit2022-09-07

  • twitter
  • finance
  • markets
  • stocks
  • wallstreet

מאגר מתויג של ציוצים כלכליים באנגלית שמחולקים לפי נושאים. הוא מתאים למי שרוצה לאמן או לבדוק מודל סיווג לטקסטים פיננסיים קצרים ברשת בלי להתחיל לתייג בעצמו.

  • 2,940הורדות בחודש
  • 43לייקים

מה זה

המאגר מורכב מ־21,107 ציוצים באנגלית שנאספו דרך ה־API של טוויטר וסווגו לטובת משימת סיווג נושאי רב מחלקתי. כל ציוץ מתויג באחת מתוך 20 תוויות מוגדרות מראש, שמכסות תחומים כמו עדכוני אנליסטים, דוחות כספיים, החלטות של בנקים מרכזיים, שוקי מטבעות, סחורות, מיזוגים ורכישות, או תנועות מניות. הכרטיס לא מפרט מי ביצע את התיוג בפועל, באילו מילות חיפוש השתמשו כדי לשלוף את הציוצים, או אם בוצע סינון של בוטים ורעש לפני ההפצה.

הנתונים כבר מחולקים לשני קבצים מוגדרים. קובץ האימון topic_train.csv כולל 16,990 ציוצים, וקובץ הוולידציה topic_valid.csv מכיל 4,118 ציוצים. לצדם המאגר מחזיק קובץ מטא-דאטה בשם topic_dataset_meta.txt ושני קבצים נוספים, כך שאין צורך לפצל את המידע ידנית לפני תחילת העבודה.

מתאים ל

  • אימון מסווג נושאים

    אימון מודל שפה קטן למיון טקסטים פיננסיים קצרים ל־20 קטגוריות מוגדרות.

  • בנצ'מרק למודלי שפה

    בדיקת יכולת של מודלים קיימים להבין הקשרים כלכליים וזיהוי נושאים בציוצים.

  • סינון פיד חדשות

    ניתוב התראות וציוצים בזמן אמת לפי תחומי עניין כמו ריבית, מיזוגים או דוחות.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על ציוצים, מה שאומר שיש בהם שפה קצרה, סלנג וקיצורים שלא בהכרח מתאימים לכתבות עיתונאיות או לדוחות רשמיים. אין כאן מילה אחת בעברית, כך שהוא לא יעזור לניתוח שוק מקומי בלי התאמה ותרגום. בנוסף, המאגר פורסם בספטמבר 2022 והכרטיס לא מציין מתי בדיוק נאספו הציוצים, מי תייג אותם ומה רמת הדיוק של התוויות. 20 תוויות עלולות לייצר חפיפות, כמו ההבדל הדק בין תנועת מניה לבין פרשנות על מניה, וחובה לדגום את התיוגים ידנית לפני שמסתמכים עליהם במוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המדווח בכרטיס הוא MIT, ולכן מבחינת יוצרי המאגר אין מניעה להשתמש בנתונים למטרות מסחריות ואימון מודלים. עם זאת, התוכן נאסף מטוויטר, כך שיש לקחת בחשבון את תנאי השימוש הכלליים של טקסטים מהרשת.

האם הדאטהסט כולל ציוצים בעברית?

לא. המאגר מוגדר ומכיל ציוצים באנגלית בלבד. אם המטרה שלכם היא לעבוד על השוק הישראלי או על שיח מקומי, תצטרכו לאסוף ולתייג נתונים בעצמכם או לתרגם את המאגר.

איך נאספו הציוצים ומי תייג אותם?

הכרטיס מציין רק שהאיסוף נעשה דרך ה־API של טוויטר עבור סיווג רב מחלקתי. אין מידע על זהות המתייגים, רמת ההסכמה ביניהם או השאילתות ששימשו לאיסוף.

כמה מקום המאגר תופס במחשב?

המאגר כולל 21,107 רשומות טקסט קצרות על פני חמישה קבצים, מתוכם שני קובצי CSV עיקריים. המשקל שלו זניח, כמה מגה-בייטים בודדים, והוא נטען מיידית בכל סביבת עבודה.

איך טוענים

טוענים את הקבצים ישירות דרך ספריית datasets באמצעות המזהה zeroshot/twitter-financial-news-topic, או מורידים את קובצי ה־CSV הפשוטים topic_train.csv ו־topic_valid.csv לעבודה מקומית. אין שום דרישה לאישור גישה, מפתח API או הרשמה מוקדמת, והמאגר פתוח לחלוטין לציבור.

המשקל הכולל של הנתונים קטן מאוד, חמישה קבצים בלבד שכוללים קצת יותר מ־21 אלף שורות טקסט, כך שההורדה לוקחת שניות בודדות ולא דורשת זיכרון מיוחד או משאבי מחשוב חריגים. השדות המרכזיים שמעניינים אתכם הם טקסט הציוץ ותווית הנושא, שנעה בין LABEL_0 ל־LABEL_19 לפי המילון שמופיע בתיעוד.

from datasets import load_dataset

ds = load_dataset("zeroshot/twitter-financial-news-topic")

הרישיון

המאגר מופץ תחת רישיון MIT, שזה רישיון מתירני שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אפשר לאמן עליו מודלים מסחריים בלי חובת שיתוף של הקוד שלכם. עם זאת, הטקסטים עצמם מקורם בטוויטר, מה שמשאיר אי-ודאות משפטית מסוימת סביב זכויות התוכן של הציוצים עצמם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗