GPT
R

ru-en-RoSBERTa

קוד פתוח

ai-forevermit2024-07-29

  • sentence-transformers
  • safetensors
  • roberta
  • feature-extraction
  • mteb

מודל אקסטרקשן דו־לשוני לרוסית ואנגלית, שמתאים למי שצריך חילוץ וקטורים, סיווג טקסט ואחזור בלי להחזיק תשתית ענקית.

  • 404Mפרמטרים
  • 514טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 136,477הורדות בחודש

מה זה

זהו מודל מסוג RoBERTa עם 24 שכבות שנועד לחילוץ מאפיינים וייצוג וקטורי של טקסט ברוסית ובאנגלית. הוא נשען על Sentence-Transformers ומכוון למשימות חיפוש סמנטי, קלסטרינג ודירוג מחדש. במקום לנסות לתמוך בעשרות שפות בצורה בינונית, ההתמקדות פה היא בשני הוקטורים הללו בלבד.

במבחני MTEB ברוסית הוא מציג תמונה מעורבת שחשוב להכיר. באחזור חדשות RiaNews הוא מגיע לציון MRR@10 של 75.44 ודמיון סמנטי ב־RUParaPhraser מניב תוצאה של 76.16, שזה שימושי מאוד. לעומת זאת, בסיווג רגשות וסקירות מקומיות כמו Georeview ו־Kinopoisk התוצאות פושרות בהרבה, סביב 49.69 ו־63.27 בהתאמה. הוא חזק באחזור עובדתי, ופחות בניתוח עדין של סנטימנט.

מתאים ל

  • אחזור וחיפוש מסמכים ברוסית

    התוצאות במבחני RiaNews מצוינות ומתאימות למנועי חיפוש פנימיים מבוססי וקטורים.

  • זיהוי כוונות ופקודות קוליות

    קיבל ציון של מעל 71 במבחני MassiveScenario, מה שמספיק לניתוב בקשות בבוטים.

  • בדיקת כפילויות ודמיון משפטים

    מתאים לזיהוי ניסוחים מקבילים בטקסטים קצרים בזכות ציון של 76.16 ב־RUParaPhraser.

איפה זה נופל

חלון ההקשר עומד על 514 טוקנים בלבד. אי אפשר לזרוק עליו מסמכים ארוכים, חוזים או עמודים שלמים בלי לחתוך אותם לפסקאות קודם. נוסף על כך, עברית בכלל לא נתמכת כאן, כך שאם המערכת שלכם מערבבת שאילתות מקומיות, תקבלו ג'יבריש וקטורי. משימות סיווג מורכבות כמו CEDR הניבו דיוק נמוך של 44.68, כך שאי אפשר לסמוך עליו בעיניים עצומות למיון קטגוריות ללא אימון נוסף.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא, המודל אומן על רוסית ואנגלית בלבד. אם תזינו עברית תקבלו ייצוגים וקטוריים לא איכותיים שלא יתאימו לחיפוש או סיווג.

האם כדאי להשתמש בו לסיווג ביקורות גולשים?

לא הייתי ממהר לבנות עליו לזה. במבחני סנטימנט וביקורות כמו Georeview ו־Kinopoisk הוא קיבל ציונים נמוכים יחסית, סביב 49 עד 63 בלבד.

איך מריצים

המודל שוקל 1.5 גיגה־בייט ונשמר בדיוק float32. עם 404 מיליון פרמטרים אין שום סיבה לשלם על API חיצוני, אלא אם אין לכם שרת בכלל. מעבד גרפי פשוט עם 4 עד 6 גיגה זיכרון יריץ אותו בקלות, ואפילו מעבד מרכזי סביר יסחוב אותו בזמני תגובה טובים ב־Sentence-Transformers.

אם יש עומס של אלפי בקשות בשנייה, מומלץ לכמת אותו ל־FP16 כדי לחתוך את צריכת הזיכרון בחצי ולהאיץ את קצב העיבוד.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("ai-forever/ru-en-RoSBERTa")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא MIT, מה שאומר שמותר לעשות איתו כמעט הכל. אפשר להשתמש בו במוצרים מסחריים, לשנות את המשקלים ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗