GPT
R

rubert-base-cased

קוד פתוח

DeepPavlovרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • feature-extraction

זהו עיבוד ממוקד של BERT לשפה הרוסית, שנועד לחילוץ ייצוגים וקטוריים מדויקים מטקסטים. הוא רלוונטי למי שצריך לעבד רוסית ולא רוצה להסתפק במודל רב לשוני כללי.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 192,760הורדות בחודש
  • 134לייקים

מה זה

הבסיס כאן הוא ארכיטקטורת BERT קלאסית עם 12 שכבות, שהותאמה ספציפית לרוסית על ידי אתחול ממודל רב לשוני ואימון על ויקיפדיה הרוסית וחדשות. המטרה המרכזית שלו היא חילוץ מאפיינים, כלומר יצירת אמבדינגס לטקסט תוך שמירה על אותיות גדולות וקטנות, פרט משמעותי בשמות עצם ובשמות פרטיים ברוסית.

במקום להשתמש במילון כללי של מודל רב לשוני שנוטה לחתוך מילים ברוסית לחתיכות קטנות מדי, בנו עבורו אוצר מילים ייעודי של תת מילים ברוסית. ההבדל מול מודלים רב לשוניים רגילים בגודל הזה מתבטא בהבנה טבעית יותר של מורפולוגיה רוסית, בלי הצורך לסחוב משקל עודף של שפות אחרות שלא מעניינות אתכם.

מתאים ל

  • חילוץ וקטורים לטקסט ברוסית

    הוא נבנה עם אוצר מילים ייעודי לרוסית, ולכן מייצר ייצוגים עשירים ומדויקים יותר לחיפוש סמנטי.

  • סיווג שמות ויישויות ברוסית

    השמירה על אותיות גדולות וקטנות קריטית לזיהוי שמות פרטיים ומקומות במבנה השפה הרוסית.

  • בסיס למודלי קצה ברוסית

    12 שכבות בגודל קומפקטי מאפשרות להתאים אותו מקומית למשימות סיווג ספציפיות בלי חומרה יקרה.

איפה זה נופל

הוא מוגבל לחלון הקשר קצר של 512 טוקנים בלבד, כך שטקסטים ארוכים כמו מאמרים מלאים או חוזים ידרשו פירוק מקדים. בנוסף, הוא אומן רק על רוסית, כך שאם המסמכים שלכם כוללים עברית, ערבית או שפות אחרות, הוא לא ידע מה לעשות איתן. הכרטיס גם לא מפרט ציוני ביצועים במשימות קצה, אז תצטרכו לבדוק בעצמכם את איכות הייצוגים על הנתונים שלכם.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא, הוא מיועד לרוסית בלבד וכולל אוצר מילים שנבנה על רוסית. לטקסטים מעורבים עדיף להשתמש במודל רב לשוני מקורי.

האם המודל מייצר טקסט חופשי ותשובות לשאלות?

לא, המשימה שלו היא חילוץ מאפיינים מתוך טקסט קיים. הוא מייצר וקטורים שמייצגים את המשמעות, לא כותב טקסט חדש בעצמו.

איך מריצים

במשקל של 1.3 ג'יגה בייט ועם 12 שכבות, אתם יכולים להריץ אותו בלי שום בעיה כמעט על כל מחשב מודרני, אפילו על מעבד רגיל בלי כרטיס גרפי ייעודי. טוענים אותו ישירות דרך ספריית transformers בסביבת פייתון סטנדרטית.

אם אתם צריכים רק לחלץ מאפיינים מכמה מאות מסמכים, אין טעם להקים שרת ייעודי או לשלם לספקי ענן על API חיצוני. מריצים מקומית וסוגרים עניין. שרת עם כרטיס מסך פשוט יהיה נחוץ רק אם יש לכם דרישות לזמני תגובה של מילישניות תחת עומס משתמשים כבד.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="DeepPavlov/rubert-base-cased")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המפתחים לא דיווחו על רישיון שימוש בכרטיס המודל. במצב כזה אין אישור מפורש לשימוש מסחרי או להפצה בתוך מוצר, ולכן מבחינה משפטית שילוב שלו במערכת מסחרית מלווה בסיכון כל עוד לא בודקים את תנאי המקור מול DeepPavlov.

הרישיון המלא בעמוד המודל ↗