GPT
E

earnings-calls-qa

קוד פתוח

laminicc-by-4.02024-03-16

  • finance

תמלילי שיחות ועידה רבעוניות של חברות עם שאלות ותשובות על הביצועים הפיננסיים שלהן. זה מיועד למי שרוצה לאמן מודלים על שליפת מידע מורכב מדוחות פיננסיים בלי לאסוף הכל לבד.

  • 490הורדות בחודש
  • 54לייקים

מה זה

המאגר מרכז תמלילים מלאים של שיחות ועידה פיננסיות של חברות שונות, בצירוף שאלות ותשובות שנבנו סביב התוכן הזה. כל שורה בקובץ מבוססת על שיחה של חברה בודדת, ומכילה את הטקסט של התמליל יחד עם זוגות של שאלות ותשובות שעוסקות בביצועים הכספיים ובנושאים מהותיים שעלו מול המשקיעים.

היוצרים שחררו את כל קוד הצינור ששימש לבניית הנתונים כקוד פתוח בגיטהאב. מי שרוצה להבין בדיוק איך חילצו את השאלות והתשובות מתוך התמלילים הגולמיים, או רוצה להריץ את אותו תהליך על שיחות חדשות שלא נכללו במאגר המקורי, יכול להסתכל ישירות בקוד המקור. הקובץ המרכזי שנמצא במאגר הוא filtered_predictions.jsonl, מה שמעיד על כך שהשאלות והתשובות עברו סינון כלשהו מתוך תחזיות מודל לפני שנארזו לחלוקה.

מתאים ל

  • אימון מודל לשאלות ותשובות

    התאמת מודלי שפה לחילוץ נתונים פיננסיים מתוך שיחות ועידה של חברות ציבוריות.

  • הערכת ביצועים בפיננסים

    בדיקת היכולת של מודלים לענות נכון על שאלות מורכבות סביב תוצאות עסקיות.

  • אימון מסווגים פיננסיים

    זיהוי נושאים ומגמות בתוך תמלילי שיחות משקיעים לפי שאלות ותשובות מוגדרות.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין פה מילה בעברית, כך שאם אתם עובדים על שוק מקומי או מסמכים של הבורסה בתל אביב זה לא יעזור לכם. לפי שמות הקבצים והקוד מדובר בפלטים של מודלים שעברו סינון, ולא בזוגות שנכתבו בידי אנליסטים אנושיים, מה שמחייב בדיקה יסודית של דיוק התשובות והזיות לפני שמשלבים אותן במוצר פעיל. בנוסף, הכרטיס לא מפרט אילו חברות נכללות, מה טווח השנים של השיחות או מתי נאספו הנתונים.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, והוא מאפשר שימוש מסחרי מלא כולל אימון מודלים פנימיים. הדרישה היחידה היא לתת קרדיט נאות ליוצרים לפי ההנחיות שלהם.

האם יש במאגר שיחות בעברית או מחברות ישראליות?

המאגר מוגדר רשמית באנגלית בלבד. יכול להיות שיש חברות ישראליות שנסחרות בארצות הברית והשיחות שלהן מופיעות באנגלית, אבל אין כאן תמלילים בעברית.

איך נוצרו השאלות והתשובות בתמלילים?

הן הופקו באמצעות צינור עיבוד נתונים ייעודי שהקוד שלו פתוח בגיטהאב, והקובץ המרכזי במאגר מעיד על סינון של תחזיות. זה אומר שסביר להניח שמודל יצר את השאלות והתשובות ולא כותב אנושי ידנית.

מה צריך כדי להרחיב את המאגר לשיחות נוספות?

היוצרים שחררו את כל קוד הצינור בריפו נפרד. אפשר לקחת את הקוד שלהם, להזין תמלילים חדשים של שיחות שלא קיימות כרגע, ולייצר שאלות ותשובות באותו מבנה בדיוק.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face בפורמט jsonlines דרך ספריית datasets או בקריאה פשוטה של שורות JSON. אין כאן שום דרישה לאישור גישה מראש או מילוי טפסים, פשוט מושכים את הקובץ filtered_predictions.jsonl ומתחילים לעבוד. השדות המרכזיים שצריך לשים לב אליהם בכל רשומה הם תמליל השיחה והשאלות והתשובות שצמודות אליו.

from datasets import load_dataset

ds = load_dataset("lamini/earnings-calls-qa")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבנות עליו מוצרים ולאמן מודלים, בתנאי אחד פשוט: מתן קרדיט ברור ליוצרים. אין כאן דרישה לשתף את הקוד שלכם או את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗