GPT
C

CryptoBERT

קוד פתוח

kk08רישיון לא דווח2023-04-13

  • transformers
  • pytorch
  • safetensors
  • bert
  • text-classification

התאמה של FinBERT לניתוח סנטימנט בטקסטים של שוק הקריפטו. הוא מסווג משפטים קצרים לחיובי או שלילי בלי צורך במשאבי מחשוב כבדים.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 836 MBמשקל הקבצים
  • 1,177הורדות בחודש

מה זה

במקום להשתמש במודל שפה כללי וענק, מדובר בגרסה ממוקדת של FinBERT שעברה אימון נוסף על דאטה ייעודי מעולם המטבעות הדיגיטליים. המשימה שלו מוגדרת ופשוטה, לקבל טקסט באנגלית ולהחזיר סיווג בינארי של חיובי (LABEL_1) או שלילי (LABEL_0).

טבלת האימונים מראה שהמודל התחיל עם Validation Loss של 0.4257 באיפוק הראשון, ירד לנקודת שפל של 0.2479 באיפוק השני, ואז התחיל לעלות בחזרה בהדרגה עד ל־0.3823 בסוף האיפוק העשירי. זה מראה בבירור על Overfitting, אימון יתר שבו המודל שינן את סט האימון הקטן במקום להמשיך להכליל טוב יותר.

מתאים ל

  • סיווג כותרות חדשות קריפטו

    ניתוח מהיר של כותרות באנגלית כדי לזהות אם הידיעה נוטה לכיוון חיובי או שלילי.

  • סינון ציוצים על מטבעות

    מעקב אחרי פיד טוויטר בזמן אמת עם מודל קל שרץ מקומית בלי עלויות API.

  • אינדיקטור פשוט לבוטים

    קלט סנטימנט בסיסי למערכות מסחר אוטומטיות שצריכות ציון בינארי על טקסט קצר.

איפה זה נופל

הבעיה המרכזית פה היא גודל הדאטה ואיכות האימון. היוצר עצמו מציין שהאימון בוצע על קורפוס קטן, ו־27 צעדים לאיפוק מעידים על מאגר זעיר במיוחד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, אין תמיכה בעברית, והפלט מחזיר תוויות טכניות של LABEL_0 ו־LABEL_1 במקום שמות ברורים. אין גם קטגוריה ניטרלית, כך שכל טקסט יידחף בכוח לחיובי או שלילי.

שאלות
נפוצות

האם המודל יודע לנתח טקסט בעברית?

לא. המודל מתבסס על ארכיטקטורת BERT באנגלית ואומן על דאטה באנגלית בלבד. טקסט בעברית יפיק תוצאות שגויות לחלוטין.

מה המשמעות של LABEL_0 ו־LABEL_1 בתוצאה?

LABEL_1 מסמן סנטימנט חיובי לגבי שוק הקריפטו, ו־LABEL_0 מסמן סנטימנט שלילי. המודל לא כולל תווית למצב ניטרלי, מה שעלול לעוות תוצאות של טקסטים יבשים ועובדתיים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בתוך פייפליין סטנדרטי של sentiment-analysis. עם משקל של 836 מגה בייט ודיוק float32, הוא שוקל מעט מאוד וירוץ בלי בעיה גם על מעבד רגיל במחשב פיתוח, בלי צורך לחמם כרטיס מסך ייעודי.

אם אתם צריכים לסווג פיד של טוויטר או כותרות חדשות בקצב סביר, אין שום סיבה לשלם על API חיצוני. המודל קל מספיק לתחזוקה עצמית בשרת פשוט, כל עוד לא מעמיסים עליו עשרות אלפי בקשות במקביל.

from transformers import pipeline

pipe = pipeline("text-classification", model="kk08/CryptoBERT")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין לכם היתר מפורש להשתמש בו, להפיץ אותו או להטמיע אותו במוצר מסחרי. לפני שאתם בונים עליו משהו שיוצא ללקוחות, אתם לוקחים סיכון זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗