GPT
L

LaBSE-en-ru

קוד פתוח

cointegratedרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • bert

גרסה מכווצת של המודל של גוגל שמייצרת וקטורים למשפטים באנגלית וברוסית. חתכו ממנו את כל שאר השפות כדי לקבל כלי קל ומהיר בלי לפגוע באיכות של שני הצימודים האלה.

  • 129Mפרמטרים
  • 512טוקנים בהקשר
  • 1.6 GBמשקל הקבצים
  • 281,218הורדות בחודש

מה זה

המודל המקורי של גוגל ידע לטפל בלמעלה ממאה שפות, אבל רוב מי שצריך לחבר בין רוסית לאנגלית סוחב סתם משקל עודף של מילון ענק. היוצר cointegrated לקח את המודל המקורי, זרק תשעים אחוז מהטוקנים במילון והשאיר רק אנגלית ורוסית. התוצאה היא 129 מיליון פרמטרים בלבד, שזה בערך עשרים ושבעה אחוזים מהגודל המקורי, בלי לאבד דיוק בשפות האלה לפי מה שדווח בכרטיס.

הוא מיועד למשימות של חילוץ וקטורים, מה שאומר שמקבלים ממנו ייצוג מספרי לכל משפט כדי לבדוק דמיון סמנטי או למיין טקסטים. אם אתם עובדים עם שפות אחרות, למשל עברית, אין לכם מה לחפש כאן כי הוא פשוט לא מכיר אותן.

מתאים ל

  • השוואת משפטים באנגלית ורוסית

    מייצר וקטורים מדויקים בשתי השפות ומאפשר למצוא תרגומים דומים בלי לסחוב מודל ענק.

  • חיפוש סמנטי בשרת מקומי זול

    הוא שוקל 1.6 גיגה בלבד, כך שאפשר להריץ חיפוש על בסיס נתונים קטן גם בלי כרטיס מסך.

  • סיווג טקסטים קצרים

    מחלץ ייצוגים יציבים של משפטים עד 512 טוקנים כדי להזין אותם למסווג פשוט.

איפה זה נופל

החיסרון המרכזי פה מוחלט, המודל יודע רק אנגלית ורוסית. אם תזינו לו עברית, שפה אירופית אחרת או אפילו מונחים טכניים שלא נכנסו למילון המקוצץ, הוא ישבור את הטקסט לחתיכות חסרות משמעות והאיכות תתרסק. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שהוא מתאים למשפטים או פסקאות קצרות ולא למסמכים שלמים.

שאלות
נפוצות

האם המודל מבין עברית?

לא. חתכו ממנו את כל השפות חוץ מאנגלית ורוסית כדי לחסוך מקום וזיכרון. אם תכניסו טקסט בעברית תקבלו תוצאות חסרות משמעות.

חייבים כרטיס מסך כדי להריץ אותו?

ממש לא. עם 129 מיליון פרמטרים הוא רץ מהר מאוד גם על מעבד רגיל, וזה כל היתרון בגרסה המקוצצת הזו מול המקור.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־1.6 גיגה בייט, ובזכות 129 מיליון פרמטרים בלבד אפשר להריץ אותו בלי בעיה על מעבד רגיל של לפטופ או שרת זול, אפילו בלי כרטיס מסך ייעודי. טוענים אותו ישירות דרך ספריית transformers בפייתון עם פקודות בסיסיות, מעבירים טקסט ומנרמלים את הפלט.

בגודל הזה אין שום סיבה לשלם ל־API חיצוני על קריאות וקטורים. הוא רץ מהר מקומית, צורך מעט זיכרון עבודה, וחוסך את התלות ברשת או בשירות צד שלישי.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="cointegrated/LaBSE-en-ru")
print(pipe("שלום"))

הרישיון

הרישיון לא מוגדר ישירות בעמוד המודל, אלא מפנה לרישיון של המודל המקורי של גוגל ב־TF Hub. במצב כזה, מי שבונה מוצר מסחרי צריך לבדוק היטב את תנאי המקור של גוגל ולא להסתמך על שימוש חופשי אוטומטי, כי אין כאן הגדרה משפטית נקייה וסגורה.

הרישיון המלא בעמוד המודל ↗