GPT
R

ruBert-base

קוד פתוח

ai-foreverapache-2.02022-03-02

  • transformers
  • pytorch
  • bert
  • fill-mask
  • PyTorch

גרסת ברט ייעודית לרוסית שמתאימה בעיקר למשימות סיווג, חיפוש והשלמת מילים. הפתרון הנכון אם צריך מודל מקודד קל ולא מייצר טקסט עבור רוסית.

  • 512טוקנים בהקשר
  • 685 MBמשקל הקבצים
  • 9,599הורדות בחודש
  • 44לייקים

מה זה

מדובר במודל מקודד מבוסס ארכיטקטורת ברט, שפותח ואומן מראש על ידי הצוות של SberDevices על שלושים ג'יגה בייט של טקסט ברוסית. הוא כולל 12 שכבות וגודל מילון של 120,138 טוקנים בשיטת BPE, מה שנותן לו כיסוי רחב של השפה הרוסית על הטיותיה לעומת מודלים רב לשוניים כלליים שמקצים לה חלק קטן מהמילון.

המטרה הראשית שלו היא fill-mask, כלומר חיזוי מילים מוסתרות בטקסט, והוא משמש בעיקר כבסיס לאימון נוסף למשימות עיבוד שפה טבעית ברוסית. הוא לא מייצר תשובות ארוכות או שיחות, אלא מפיק ייצוגים וקטוריים מדויקים לטקסט נתון.

מתאים ל

  • סיווג טקסטים ברוסית

    מתאים לאימון נוסף לצורך ניתוח סנטימנט, זיהוי כוונות משתמש או מיון פניות תמיכה בשפה הרוסית.

  • חילוץ ישויות ושמות

    מבנה השכבות ומילון הטוקנים הרחב מאפשרים לזהות שמות, ארגונים ותאריכים מתוך משפטים קצרים ומובנים.

  • השלמת מילים חסרות

    ביצוע משימת fill-mask מובנית לבדיקת דקדוק, הצעת מילים למשתמש או תיקון שגיאות הקלדה.

איפה זה נופל

זהו מודל מקודד בלבד שמוגבל לחלון הקשר של 512 טוקנים, כך שהוא לא מסוגל להתמודד עם מסמכים ארוכים ברצף ולא יודע לייצר טקסט חופשי. כרטיס המודל מספק נתונים טכניים בסיסיים בלבד, ללא פירוט על הרכב דאטה האימון או הטיות אפשריות. בנוסף, הוא תומך אך ורק ברוסית, כך שאם המערכת שלכם מערבבת עברית, אנגלית ורוסית באותו משפט, הוא כנראה ייכשל בעיבוד החלקים הזרים.

שאלות
נפוצות

האם אפשר להשתמש בו כמו בצ'אטבוט?

לא, זה מודל מסוג מקודד ולא מודל יוצר. הוא נועד לנתח ולהבין טקסט קיים או להשלים מילים בודדות, ולא לנהל שיחה או לסכם פסקאות.

איך הוא מתמודד עם עברית או אנגלית?

הוא אומן על רוסית בלבד עם מילון ייעודי. טקסט בעברית או באנגלית לא יפוענח כראוי ויוביל לפלט לא תקין, ולכן הוא מתאים רק לעיבוד רוסית נקייה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון כמודל BertForMaskedLM. עם משקל של 685 מגה בייט וסדר גודל של 178 מיליון פרמטרים, כל מעבד סטנדרטי במחשב אישי יכול להריץ אותו להסקה בלי לגמגם, וכרטיס מסך בסיסי לחלוטין יספיק לאימון מהיר.

בגודל הזה אין שום סיבה לשלם לספקי API חיצוניים. אתם מורידים את חמשת הקבצים פעם אחת ומריצים לוקאלית על השרת שלכם, גם מטעמי עלות וגם כדי לשמור על פרטיות המידע אם מעבדים טקסט רגיש.

from transformers import pipeline

pipe = pipeline("fill-mask", model="ai-forever/ruBert-base")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 685 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש בתוך מוצרים. הדרישה העיקרית היא לשמור על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗