GPT
R

rubert-tiny

קוד פתוח

cointegratedmit2022-03-02

  • transformers
  • pytorch
  • safetensors
  • bert
  • pretraining

גרסה מזערית של ברט לרוסית ואנגלית ששוקלת בערך עשירית מברט רגיל. היא מתאימה למי שחייב להריץ מודל מהיר וזול במיוחד על מעבד פשוט, ומוכן לוותר על דיוק בשביל זה.

  • 12Mפרמטרים
  • 512טוקנים בהקשר
  • 350 MBמשקל הקבצים
  • 36,905הורדות בחודש

מה זה

מדובר במודל שזוקק מתוך גרסה רב לשונית גדולה של ברט, תוך התמקדות ברוסית ובאנגלית בלבד. הוא מחזיק 12 מיליון פרמטרים וכולל שלוש שכבות בלבד, מה שהופך אותו למהיר פי עשרה ממודל בסיס רגיל בגדלים האלה. האימון שלו התבסס על כמה מאגרי נתונים כמו תרגומי יאנדקס, טטואבה וקורפוסים נוספים, תוך שימוש בידע ממודלים כמו לייזר ולאבס כדי ליישר את הייצוגים בין השפות.

התפקיד העיקרי שלו הוא הפקת וקטורים מייצגים ממשפטים דרך הטוקן הראשון, או כבסיס קל לאימון מותאם למשימות קלאסיות כמו סיווג רגש וזיהוי ישויות. בגלל הגודל הזעיר הוא לא מיועד להבנה עמוקה של טקסטים מורכבים, אלא למצבים שבהם רוצים לחסוך משאבים בלי להסתבך עם שרתים כבדים.

מתאים ל

  • סיווג רגש מהיר ברוסית

    אימון שכבה קלה על גבי המודל לזיהוי ביקורות חיוביות ושליליות בלי להעמיס על השרת.

  • זיהוי ישויות קל משקל

    שליפת שמות ומושגים מטקסטים ברוסית במערכות שמחייבות זמן תגובה מיידי.

  • ייצוג וקטורי דו לשוני

    הפקת וקטורים ממשפטים לצורך השוואת דמיון בין רוסית לאנגלית עם חתימת זיכרון מינימלית.

איפה זה נופל

זה מודל קטן עם שלוש שכבות בלבד, ולכן הוא לא מתאים למשימות הבנה מורכבות או לחילוץ הקשרים עדינים. הוא מוגבל לרוסית ולאנגלית, כך שהוא לא יעזור בכלל לעברית או לשפות אחרות. מעבר לזה, המפתח מודה שיש גרסה שנייה שמתעלה עליו כמעט בכל מבחן ברוסית, כך ששימוש בגרסה הזו מוגבל בעיקר למי שחייב תאימות ישירה לקוד קיים.

שאלות
נפוצות

האם המודל מבין עברית?

לא. המודל זוקק ואומן ספציפית על טקסטים ברוסית ובאנגלית, ואין לו תמיכה בטקסטים בעברית.

למה להשתמש בגרסה הזו ולא בגרסה השנייה?

rubert-tiny2 נחשב עדיף ברוב המדדים ומחזיק מילון רחב יותר. הבחירה בגרסה הראשונה מוצדקת בעיקר אם הפרויקט שלכם כבר תלוי בגדלי הווקטורים או במילון הספציפי שלה.

האם חובה להשתמש בכרטיס מסך כדי להפיק וקטורים?

ממש לא. בגלל שיש לו רק שנים עשר מיליון פרמטרים, הוא רץ מהר מאוד גם על מעבד רגיל בלי לייצר עומס כבד על הזיכרון.

איך מריצים

אין צורך בשום חומרה מיוחדת או כרטיסי מסך יקרים בשביל להריץ אותו. הוא רץ ישירות מתוך ספריית transformers בפייתון עם sentencepiece, ויעבוד בלי למצמץ גם על מעבד רגיל של מחשב נייד ישן. מורידים את הטוקנייזר ואת המודל ישירות, מעבירים את הטקסט ומקבלים וקטור מנורמל ברוחב של שלוש מאות ושנים עשר ממדים.

היוצר עצמו מציין שיש גרסה מעודכנת יותר, rubert-tiny2, שמגיעה עם מילון רחב יותר ומשיגה תוצאות עדיפות כמעט בכל משימה בשפה הרוסית. אם אתם שוקלים להריץ את הגרסה הראשונה, כדאי לבדוק קודם אם הדור השני לא נותן מענה טוב יותר לאותם צרכים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="cointegrated/rubert-tiny")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את המשקלים, לאמן אותו מחדש ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצי הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗