GPT
F

finbert

קוד פתוח

ProsusAIרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זה מודל שמסווג סנטימנט בטקסטים פיננסיים לשלוש תוויות בלבד. הוא מתאים למי שרוצה לנתח דוחות או חדשות שוק באנגלית בלי להסתבך עם הנחיות למודלי ענק.

  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 5,364,262הורדות בחודש
  • 1,240לייקים

מה זה

מדובר בהתאמה ייעודית של ארכיטקטורת BERT לקריאת טקסט פיננסי. היוצרים שלו לקחו את הבסיס המוכר, אימנו אותו על קורפוס רחב מעולם הכלכלה, וביצעו כוונון עדין ישירות על מאגר Financial PhraseBank. התוצאה מחזירה התפלגות הסתברויות דרך שכבת סופטמקס לשלושה מצבים מדויקים, חיובי, שלילי או ניטרלי.

בניגוד למודלים כלליים שמתבלבלים ממונחים מקצועיים כמו קיצוץ עלויות או הפסד תפעולי, הוא אומן להבין את המשמעות של מילים כאלה בהקשר של שוק ההון. העובדה שהוא כולל 12 שכבות של סיווג ישיר ולא מודל גנרטיבי חוסכת מכם את הצורך לחלץ תשובות מתוך פלט טקסטואלי חופשי, ומבטיחה סיווג עקבי ומהיר מאוד לכל משפט שתזינו אליו.

מתאים ל

  • סיווג מבזקי חדשות כלכליות

    הוא מזהה מיד אם כותרת על מניה מבטאת מגמה חיובית, שלילית או ניטרלית.

  • ניתוח שיחות ועידה רבעוניות

    אפשר לחתוך תמלילי שיחות למשפטים ולמדוד את הסנטימנט הכולל של ההנהלה.

  • סינון פידים של משקיעים

    מיון אוטומטי של הודעות קצרות בפורומים לפי יחס חיובי או שלילי לשוק.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר לזרוק עליו דוח שנתי מלא ולקוות לטוב. תצטרכו לחתוך את המסמכים לפסקאות או למשפטים בודדים לפני השליחה. בנוסף, הוא תומך באנגלית בלבד. אם תזינו דיווחי בורסה מתל אביב בעברית, תקבלו ג'יבריש. המודל פולט רק שלוש תוויות סנטימנט, בלי הסברים ובלי זיהוי ישויות.

שאלות
נפוצות

אפשר לנתח איתו דוחות כספיים בעברית?

לא. המודל אומן על אנגלית בלבד ולא מבין עברית. כדי לנתח נתונים מקומיים תצטרכו לתרגם אותם קודם לאנגלית או לחפש מודל אחר.

כמה זיכרון צריך כדי להריץ אותו בשרת?

הקבצים שוקלים 1.2 גיגה בייט, כך שזיכרון עבודה של 2 עד 4 גיגה בייט יספיק לחלוטין. הוא רץ בקלות על שרתים פשוטים וזולים בלי שום צורך בחומרה ייעודית.

איך מריצים

אתם מושכים ומריצים אותו דרך ספריית transformers בשורות קוד בודדות, בארכיטקטורת BertForSequenceClassification. עם משקל של 1.2 גיגה בייט בלבד, לא צריך פה כרטיסי מסך מפלצתיים. כל מעבד מודרני ממוצע מריץ אותו מקומית בזמני תגובה מצוינים, וכרטיס מסך פשוט יספיק לעיבוד של מאות אלפי שורות בדקות ספורות.

אם אתם צריכים לסווג מדי פעם כמה משפטים בודדים מתוך פיד חדשות, קריאה לשרת מרוחק עשויה לחסוך תחזוקה. ברגע שיש לכם דאטהסט של עשרות אלפי דיווחים או שאתם דוגמים נתונים ברצף, עדיף בהרבה להוריד את הקבצים ולהריץ הכל אצלכם.

from transformers import pipeline

pipe = pipeline("text-classification", model="ProsusAI/finbert")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון רשמי בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר עסקי חושף אתכם לסיכון משפטי עד שתקבלו אישור ישיר מהמפתחים.

הרישיון המלא בעמוד המודל ↗