GPT
S

Solon-embeddings-large-0.1

קוד פתוח

OrdalieTechmit2023-12-09

  • transformers
  • safetensors
  • xlm-roberta
  • feature-extraction
  • mteb

מודל שיכוך ייעודי לצרפתית שעוקף מודלים סגורים במבחני דמיון טקסט. מי שמפתח מערכת חיפוש או סיווג לטקסטים בצרפתית יקבל כאן דיוק גבוה בלי תלות בשירות ענן חיצוני.

  • 560Mפרמטרים
  • 514טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 292,557הורדות בחודש

מה זה

מדובר במודל מבוסס XLM-Roberta עם 560 מיליון פרמטרים ו־24 שכבות, שנועד לחילוץ מאפיינים וייצוג וקטורי של טקסטים בצרפתית. הוא אומן ישירות עבור השפה הזו כדי לתת מענה ממוקד במשימות של אחזור מידע, דמיון סמנטי וסיווג כוונות. בכרטיס המודל מוצגת השוואה מול מודלים רב-לשוניים מוכרים כמו אלה של קוהיר ו־OpenAI, שבה הוא השיג ציון ממוצע של 0.7490 בתשעה מבחני ביצועים שונים בצרפתית.

התוצאה הזו אומרת שבמשימות כמו דירוג מחדש או סיווג ביקורות ותרחישים בצרפתית, הוא מבין את הניואנסים של השפה טוב יותר ממודלים כלליים גדולים. כדי להגיע לביצועים המרביים שלו בשליפת מסמכים, צריך להוסיף את הקידומת query לפני שאילתות החיפוש, בעוד שעבור פסקאות הטקסט שמאנדקסים לא נדרשת שום תוספת. מפתחי המודל יצרו בעצמם שניים מתשעת המבחנים כדי לבדוק דירוג מחדש ודמיון סמנטי בצרפתית, והעלו את סקריפט הבדיקה לגיטהאב.

מתאים ל

  • חיפוש סמנטי בצרפתית

    שליפת פסקאות מדויקת באמצעות הוספת קידומת השאילתה המומלצת למנועי חיפוש.

  • סיווג כוונות בבוטים

    זיהוי כוונות של משתמשים דוברי צרפתית על בסיס ציוני התאמה גבוהים בבנצ'מרק.

  • דירוג תוצאות מחדש

    שקלול מחדש של תוצאות חיפוש טקסטואלי לקבלת התאמה סמנטית טובה יותר.

איפה זה נופל

המגבלה המרכזית היא חלון הקשר של 514 טוקנים בלבד. הוא לא מסוגל לקרוא מסמכים ארוכים ברצף, ולכן תצטרכו לחתוך טקסטים לפסקאות קצרות לפני ההמרה לווקטור. בנוסף, המודל מוגדר ומכוון רק לשפה הצרפתית, כך שהוא חסר תועלת לחלוטין עבור עברית או אנגלית. חיסרון נוסף נובע מזה ששניים מתוך תשעת המבחנים שבהם נבדק פותחו על ידי אותה חברה שיצרה את המודל, מה שדורש בדיקה זהירה על הדאטה האמיתי שלכם.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל אומן והוגדר עבור השפה הצרפתית בלבד. טקסטים בעברית ייצרו וקטורים לא מדויקים שלא מייצגים נכון את המשמעות.

איך צריך לעבד את הטקסט לפני שמייצרים וקטור?

עבור פסקאות ומסמכים שמאנדקסים מעבירים את הטקסט כמו שהוא. עבור שאילתת חיפוש חייבים להוסיף את המחרוזת query לפני הטקסט כדי לקבל את הדיוק המובטח.

איך מריצים

המודל שוקל 2.1 גיגה-בייט ומגיע בדיוק float32, כך שתוכלו להריץ אותו בקלות על כרטיס מסך בסיסי עם 4 עד 8 גיגה זיכרון דרך ספריית transformers. אם אין לכם עומס כבד אפשר אפילו לחשב איתו וקטורים על גבי מעבד רגיל, אם כי זה ייקח יותר זמן בכל באץ'.

מול מודלים קטנים יותר כמו גרסת הבסיס של אותה סדרה, הגרסה הזו נותנת שיפור קל בדיוק אבל דורשת יותר זיכרון וחישוב. להריץ אותו עצמאית משתלם כשיש כמויות גדולות של טקסט בצרפתית שרוצים לאנדקס בלי לשלם לפי טוקן לחברות ענן חיצוניות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="OrdalieTech/Solon-embeddings-large-0.1")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, שזה הרישיון הפתוח והנוח ביותר שיש. אפשר להשתמש בו בפרויקטים מסחריים, לשנות אותו ולהפיץ אותו בתוך המוצר שלכם בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗