GPT
C

cryptobert

קוד פתוח

ElKulakomit2022-06-20

  • transformers
  • pytorch
  • safetensors
  • roberta
  • text-classification

מודל סיווג קטן וממוקד לניתוח סנטימנט של שוק הקריפטו ברשתות החברתיות. הוא מזהה אם טקסט הוא שורי, דובי או ניטרלי לפי שפה של סוחרים.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 954 MBמשקל הקבצים
  • 518,957הורדות בחודש

מה זה

מדובר בהתאמה של bertweet-base לתחום הקריפטו, שאומנה על יותר מ־3.2 מיליון פוסטים מטוויטר, טלגרם, רדיט ו־StockTwits. מעל בסיס השפה הזה הוסיפו ראש סיווג שאומן על שני מיליון פוסטים מתויגים מ־StockTwits, כך שהוא מיועד לקלוט סלנג, קיצורים וסגנון כתיבה של קהילות מסחר.

הפלט שלו פשוט מאוד, שלוש תוויות בלבד: שורי, דובי או ניטרלי. בניגוד למודלי שפה כלליים שלא מבינים את המשמעות של סלנג פיננסי ברשת, כאן הדאטה-סט נאסף ישירות מערוצי מסחר גדולים כמו קבוצות טלגרם של בורסות מובילות ודיונים ברדיט בין 2020 ל־2022.

מתאים ל

  • סריקת ערוצי טלגרם למסחר

    סיווג מהיר של הודעות קצרות בקבוצות קריפטו לאיתור שינויים בסנטימנט.

  • סינון פידים ב־StockTwits

    המודל אומן על הדאטה הזה בדיוק, ולכן מתאים לפילוח משתמשים לפי פוזיציה.

  • מדד פחד ותאוות בצע מותאם

    איסוף רציף של תגובות ברשתות ויצירת ציון שורי או דובי יומי.

איפה זה נופל

המודל הוגבל באימון לאורך רצף של 128 טוקנים בלבד. למרות שהארכיטקטורה תומכת טכנית בעד 514 טוקנים, היוצר מבהיר במפורש שלא כדאי לחרוג מ־128, כך שהוא לא מתאים לניתוח מאמרים, חדשות ארוכות או שרשורים מורכבים.

בנוסף, כל הדאטה נאסף באנגלית בין 2018 ל־2022. הוא לא מבין עברית, לא מכיר מטבעות חדשים או נרטיבים שנוצרו אחרי אמצע 2022, ואינו מסוגל לחלץ תובנות מעבר לשלוש התוויות הקבועות מראש.

שאלות
נפוצות

האם המודל מזהה עברית?

לא. המודל אומן אך ורק על טקסטים באנגלית מרשתות חברתיות, ואין לו יכולת לנתח תוכן בעברית.

אפשר להשתמש בו לניתוח כתבות חדשות מלאות?

לא מומלץ בכלל. האימון הוגבל לרצפים של 128 טוקנים, ולכן הוא מתאים רק להודעות קצרות, ציוצים וטוקבקים.

האם הוא יודע לנתח סנטימנט לפרויקטים חדשים שיצאו השנה?

הוא יזהה את הסנטימנט הכללי של המשפט, אבל נתוני האימון נאספו עד יוני 2022, כך ששמות של מטבעות חדשים יהיו זרים לו.

איך מריצים

עם 125 מיליון פרמטרים ומשקל קבצים של פחות מג'יגה-בייט, מריצים אותו בקלות על כל מעבד מודרני בלי לחשוב פעמיים. אין שום צורך בכרטיס מסך יקר או בתשתית ענן מורכבת, וספריית transformers תטען אותו בשניות ספורות.

אם אתם צריכים לנתח אלפי הודעות בשנייה בזמן אמת, מאיץ גרפי בסיסי יספיק לגמרי כדי לרוקן את התור. שירותי API חיצוניים יהיו כאן בזבוז כסף, כי עלות האירוח העצמי של מודל כזה אפסית.

from transformers import pipeline

pipe = pipeline("text-classification", model="ElKulako/cryptobert")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא לעשות בו מה שתרצו. מותר להטמיע אותו במוצרים מסחריים, לשנות את המשקלים או להריץ אותו פנימית בארגון. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗