GPT
F

finbert-tone-chinese

קוד פתוח

yiyanghkustapache-2.02024-02-06

  • transformers
  • safetensors
  • bert
  • text-classification
  • financial-sentiment-analysis

המודל מנתח סנטימנט פיננסי בטקסטים בסינית ומחזיר סיווג חיובי, שלילי או ניטרלי. הוא מתאים למי שבונה פייפליין לעיבוד דוחות אנליסטים וחדשות כלכליות מהשוק הסיני.

  • 102Mפרמטרים
  • 512טוקנים בהקשר
  • 390 MBמשקל הקבצים
  • 32,617הורדות בחודש

מה זה

מדובר בהתאמה ייעודית של bert-base-chinese למשימה ספציפית מאוד, ניתוח סנטימנט של משפטים מתוך דוחות פיננסיים. האימון נעשה על דאטה-סט פרטי שכולל בערך שמונת אלפים משפטים מדוחות אנליסטים, כך שהוא מכיר את הז'רגון של הדיווחים האלה ולא מנסה לפענח שפה יומיומית.

התוצאות במבחן מראות דיוק של 0.88 וציון מאקרו F1 של 0.87 על פני שלוש תוויות: ניטרלי, חיובי ושלילי. בשטח, ציון F1 כזה מעיד על איזון טוב בין הקטגוריות, מה שמונע מהמודל להכריז על כל טקסט יבש כניטרלי רק כדי לצבור נקודות קלות. עם 102 מיליון פרמטרים ו־12 שכבות, הוא מתמקד רק בסיווג ולא מייצר טקסט, ולכן הוא עושה את העבודה הזו מהר בהרבה ממודלי שפה כלליים.

מתאים ל

  • סיווג דוחות אנליסטים

    המודל אומן בדיוק על הז'רגון הזה ומזהה סנטימנט עסקי מדויק מתוך שורות דיווח יבשות.

  • סינון מבזקי חדשות בסין

    מאפשר לסווג מאות עדכוני בורסה קצרים בזמן אמת על חומרה מקומית פשוטה.

  • מעקב אחרי חברות סיניות

    עוזר לחלץ אותות מסחר חיוביים או שליליים מתוך הודעות רשמיות לעיתונות.

איפה זה נופל

האימון התבסס על כמות קטנה יחסית של כ־8,000 משפטים מדוחות אנליסטים בלבד. אם תזרקו עליו פוסטים מפורומים, טוויטר או רשתות חברתיות בסינית, הוא יתקשה מאוד עם שפת רחוב או סרקזם. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים והוא תומך רק בשפה הסינית, כך שטקסטים בעברית או באנגלית יקבלו פלט שגוי.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לנתח טקסטים בעברית או באנגלית?

לא. המודל מתבסס על מודל בסיס לסינית ואומן אך ורק על השפה הזו. לטקסטים בשפות אחרות תצטרכו להשתמש בגרסת FinBERT המקורית לאנגלית או לתרגם את המידע מראש.

האם הוא מסוגל לקרוא דוח כספי שלם בבת אחת?

לא, חלון הקלט מוגבל ל־512 טוקנים והוא נבנה לעבודה ברמת המשפט הבודד. כדי לנתח מסמך שלם צריך לפרק אותו למשפטים, להריץ סיווג על כל אחד בנפרד ולשקלל את התוצאות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם BertTokenizerFast ומחלקה של AutoModelForSequenceClassification. הקבצים שוקלים בסך הכול 390 מגה-בייט, כך שלא צריך שרת מפלצתי או כרטיס גרפי יקר כדי לעבוד איתו. אפשר להריץ אותו בקלות על כל מעבד מודרני, או על כרטיס מסך בסיסי וזול אם רוצים לתת מענה לעשרות משפטים בשנייה.

ההבדל העיקרי מול שימוש ב־API חיצוני הוא עניין העלות והפרטיות. במקרה הזה המודל קטן כל כך שאין סיבה אמיתית לשלם לספק ענן על כל קריאה, אלא אם אתם לא רוצים להחזיק תשתית פייתון בכלל ומעדיפים נקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("text-classification", model="yiyanghkust/finbert-tone-chinese")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 390 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, מה שאומר שמותר להשתמש בו לצרכים מסחריים בלי לשלם תמלוגים. אפשר לשלב אותו במוצר סגור, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗