GPT
R

ruRoberta-large

קוד פתוח

ai-foreverרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • roberta
  • fill-mask
  • PyTorch

מודל אנקודר ייעודי לרוסית שמיועד למשימות הבנה והשלמת מילים. הוא מביא בסיס שפה חזק למי שבונה קלסיפיקציה או חיפוש סמנטי בשוק דוברי הרוסית.

  • 514טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 12,006הורדות בחודש
  • 59לייקים

מה זה

מדובר באנקודר מסוג RoBERTa עם 355 מיליון פרמטרים ו־24 שכבות, שאומן מראש על מאגר רוסי בהיקף של 250 גיגה בייט. צוות SberDevices בנה אותו למשימת fill-mask, עם טוקנייזר מסוג BBPE שמחזיק מילון של 50,257 מונחים. הוא מתרכז בהבנה עמוקה של תחביר והקשר מקומי בתוך השפה הרוסית.

ההבדל מול מודלים רב לשוניים כלליים בגודל דומה הוא המיקוד. במקום לחלוק את המילון עם עשרות שפות אחרות, כל המקום מוקדש לרוסית. זה מייצר ייצוג וקטורי מדויק יותר של טקסטים, במיוחד במבנים דקדוקיים מורכבים.

מתאים ל

  • סיווג טקסטים ברוסית

    אימון שכבת סיווג על גבי הייצוגים של המודל לזיהוי כוונות או ניתוח סנטימנט.

  • חילוץ ישויות ותגיות

    זיהוי שמות, מקומות ומונחים מתוך טקסט רוסי קצר באמצעות הקשר דו כיווני.

  • השלמת מילים חסרות

    שחזור מילים שהושמטו או תיקון שגיאות כתיב במסגרת חלון של 514 טוקנים.

איפה זה נופל

המודל הזה הוא אנקודר בלבד. הוא לא צ'אטבוט, לא יודע לנהל שיחה ולא מסוגל לייצר פסקאות חדשות. חלון ההקשר שלו מוגבל ל־514 טוקנים בלבד, כך שטקסטים ארוכים, מסמכים שלמים או חוזים ייחתכו מיד. מעבר לזה, הכרטיס לא מציג תוצאות מדידה מספריות של דיוק, כך שחובת הבדיקה על הדאטה האמיתי שלכם.

שאלות
נפוצות

האם המודל מתאים ליצירת טקסט חופשי ותשובות למשתמשים?

לא. מדובר במודל שמנתח טקסט ומשלים מילים חסרות, לא מודל יוצר. הוא לא יכתוב עבורכם מאמרים או מענה לפניות לקוחות.

האם אפשר להשתמש בו ישירות לניתוח עברית?

הוא אומן על טקסטים ברוסית עם מילון ייעודי לשפה זו. הוא לא מיועד לעברית ולא ייתן תוצאות סבירות בשפות אחרות.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי או אפילו על מעבד רגיל, בלי להסתבך עם שרתים יקרים. טוענים אותו ישירות דרך ספריית transformers בפייתון לפעולות הסקת מסקנות או כבסיס לאימון המשך.

אם אתם רק צריכים לסווג טקסטים בכמויות קטנות או לבצע ניסויי מעבדה, אין שום סיבה לחפש פתרונות ענן מנוהלים. ההרצה המקומית פשוטה וזולה יותר מתשלום לפי קריאה לספק חיצוני.

from transformers import pipeline

pipe = pipeline("fill-mask", model="ai-forever/ruRoberta-large")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר מסחרי חושף אתכם לסיכון משפטי עד שהמפתח יבהיר את תנאי ההפצה.

הרישיון המלא בעמוד המודל ↗