GPT
S

sentence-camembert-large

קוד פתוח

dangvantuanapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • safetensors
  • camembert

הטמעה וקטורית מדויקת בצרפתית בלי לשלם על API חיצוני. מודל שמיועד ספציפית לחיפוש סמנטי והשוואת משפטים, ועוקף במבחני שפה מודלים כלליים.

  • 337Mפרמטרים
  • 514טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 27,266הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס CamemBERT שעבר אימון ייעודי למשימות דמיון בין משפטים בצרפתית. הרעיון פשוט: הוא מקבל טקסט ומחזיר וקטור שמייצג את המשמעות שלו, כדי שתוכלו לחשב מרחק מול טקסטים אחרים במאגר. הוא פותח על ידי La Javaness כדי לתת מענה ממוקד לשפה הצרפתית, שבה מודלים רב-לשוניים נוטים לאבד דיוק ודקויות.

במבחני STSb בצרפתית המודל הציג מתאם ספירמן של 85.8 במבחן הטסט, מול 81.64 של גרסת הבסיס שלו וכ־77.5 של מודל רב-לשוני כמו distiluse. המשמעות בפועל היא שהוא מבין היטב ניואנסים, סלנג מקומי או מבנים תחביריים מורכבים בצרפתית, הרבה מעבר למודלים רב-לשוניים פופולריים שלא ראו מספיק דאטה צרפתי טהור.

מתאים ל

  • חיפוש סמנטי בצרפתית

    שליפת מוצרים או תוכן בצרפתית לפי משמעות השאילתה ולא רק התאמת מילים יבשה.

  • מניעת כפילויות בפניות

    זיהוי כרטיסי תמיכה או שאלות דומות שנכתבו בניסוחים שונים לחלוטין בצרפתית.

  • חלוקת מסמכים לאשכולות

    קיבוץ אוטומטי של פסקאות ומשפטים קצרים לפי נושאים במאגרי מידע מבוססי צרפתית.

איפה זה נופל

הוא מיועד אך ורק לצרפתית, נקודה. אל תנסו להכניס לו עברית, אנגלית או שילוב של שפות, כי התוצאות פשוט לא יהיו שימושיות. בנוסף, חלון ההקשר שלו מוגבל ל־514 טוקנים, כך שהוא מתאים למשפטים, פסקאות קצרות או כותרות, אבל ייחתך אם תנסו לזרוק עליו מסמכים שלמים בלי לחלק אותם לחתיכות מראש. הוא גם נבדק בעיקר על מערך STSb, כך שאם יש לכם טקסט רפואי או משפטי כבד, תצטרכו לבדוק בעצמכם איך הוא מחזיק מול הז'רגון הזה.

שאלות
נפוצות

האם המודל תומך בשאילתות בעברית או באנגלית?

לא. המודל אומן בלעדית על השפה הצרפתית וכל ניסיון לחשב וקטורים לטקסט בשפה אחרת יפיק תוצאות רנדומליות לחלוטין. אם המערכת שלכם דו-לשונית או כוללת עברית, תצטרכו מודל רב-לשוני או תרגום מוקדם.

למה לקחת את גרסת ה־Large ולא את ה־Base?

גרסת ה־Large מציגה דיוק עדיף של 85.8 במבחן STSb לעומת 82.36 בגרסת ה־Base. אם כרטיס המסך שלכם יכול לסחוב קובץ של 3.8 גיגה-בייט, הדיוק הנוסף בהבנת ניואנסים שווה את הזיכרון הנוסף.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בשתי שורות קוד בפייתון ומריצים עליו פקודת encode. עם 337 מיליון פרמטרים ומשקל קבצים של 3.8 גיגה-בייט, לא צריך מפלצת כדי לעבוד איתו: כרטיס מסך בסיסי עם 8 עד 12 גיגה זיכרון יחזיק אותו בקלות בזמן הסקה, ואפילו מעבד סביר יספיק אם אין לכם עומס של אלפי בקשות בשנייה.

אם יש לכם שרת מקומי או מכונה פשוטה בענן, עדיף להריץ אותו עצמאית ולא להסתמך על API חיצוני. הוא קל לתחזוקה, אין עלויות קריאה פר-טוקן, והוא לא מצריך תשתית מורכבת של מודלי שפה ענקיים כדי להוציא וקטורים מהר.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("dangvantuan/sentence-camembert-large")
v = m.encode(["שלום עולם"])

הרישיון

רישיון Apache 2.0 פתוח לגמרי. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, לארח אותו על שרתים שלכם ולהפיץ אותו ללקוחות, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗