GPT
C

Cohere-embed-multilingual-v3.0

קוד פתוח

CohereLabsרישיון לא דווח2023-11-02

  • transformers
  • mteb
  • model-index
  • endpoints_compatible

הורדה של מודל וקטורי רב לשוני מבית CohereLabs. מתאים למי שבונה חיפוש סמנטי, זיהוי כוונות או קלסיפיקציה ורוצה ביצועים מוכחים על מדדי MTEB.

  • 512טוקנים בהקשר
  • 21.2 MBמשקל הקבצים
  • 16,120הורדות בחודש
  • 108לייקים

מה זה

המאגר מכיל קבצים של מודל ההטמעות הרב לשוני של החברה, שתומך בחלון הקשר של 512 טוקנים ומבוסס על ספריית transformers. הוא מייצר וקטורים עבור משימות אחזור, דמיון סמנטי, מיון וחלוקה לאשכולות. המספרים מראים דיוק גבוה במיוחד בסיווג פולאריות של טקסט עם 95.6% דיוק, וציוני דמיון סמנטי שחוצים את ה־88 במדדים כמו STS15.

במשימות אחזור מידע התוצאות משתנות מאוד לפי התחום. בעוד שבזיהוי שאלות כפולות במאגרי מידע כלליים כמו Quora הוא מגיע ל־88.9 במדד ndcg_at_10, באחזור טקסטים מדעיים מורכבים כמו SCIDOCS הציון צונח ל־19.3 בלבד.

מתאים ל

  • זיהוי כפילויות בפורומים

    משיג ציון מקסימלי של מעל 99% דיוק בזיהוי שאלות כפולות במדד SprintDuplicateQuestions.

  • סיווג פניות ושירות לקוחות

    מגיע ל־86% דיוק במיון כוונות במאגר Banking77, מה שמתאים לניתוב פניות תמיכה.

  • סינון תגובות וסנטימנט

    רושם 95.6% דיוק בזיהוי קוטביות של ביקורות, שימושי לקטלוג מהיר של פידבק משתמשים.

איפה זה נופל

הכרטיס חושף חולשות ברורות בכמה תרחישים. משימות סיכום מקבלות ציוני מתאם נמוכים מאוד סביב 31 בלבד, ובמשימות אחזור טכניות ומדעיות כמו Mathematica הציון עומד על 29.6. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שלא תוכלו להזין מסמכים ארוכים בבת אחת בלי לחתוך אותם קודם.

שאלות
נפוצות

האם המודל תומך בעברית למרות שהבנצ'מרקים באנגלית?

השם מעיד על תמיכה רב לשונית, אך תוצאות המדידה שפורסמו מתרכזות בעיקר בנתונים באנגלית. אין נתונים רשמיים בכרטיס לגבי איכות ההטמעה בעברית. מומלץ לבדוק את איכות ההטמעות על סט נתונים מקומי לפני שמסתמכים עליו.

האם כדאי להריץ את המודל מקומית או לצרוך אותו דרך הרשת?

אם אתם מתלבטים, עדיף לבדוק תחילה את ה־API. הקבצים בעמוד שוקלים 21.2 מגה בייט בלבד, מה שמעיד כי ייתכן שלא מדובר במודל המלא עצמו אלא בהגדרות או ברכיב חלקי. שימוש בנקודת קצה חיצונית יבטיח שאתם מקבלים את הביצועים המלאים שנמדדו.

איך מריצים

המשקל הכולל של הקבצים במאגר הוא 21.2 מגה בייט בלבד בשבעה קבצים, כך שמבחינת שטח אחסון וזיכרון אפשר לטעון אותו ישירות דרך ספריית transformers בלי שום צורך בחומרה ייעודית או כרטיס מסך יקר. הוא יכול לרוץ על מעבד פשוט כמעט בכל סביבת עבודה או שרת קצה.

עם זאת, הנפח הזעיר הזה מחשיד ביחס למודל שפה רב לשוני מלא, ולכן סביר להניח שמדובר בקובצי הגדרות או עטיפה ולא במשקולות המודל המלאות. אם אתם צריכים הטמעות בהיקף גדול בלי לנהל תשתית והתקנות מקומיות, שימוש ישיר ב־API הרשמי חוסך את התעלומה הזו לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="CohereLabs/Cohere-embed-multilingual-v3.0")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 21.2 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל לא דווח במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו, להפיץ אותו או להטמיע אותו במוצר מסחרי. לפני שמשלבים אותו בקוד פעיל, צריך לוודא ישירות מול Cohere מה תנאי השימוש החלים עליו.

הרישיון המלא בעמוד המודל ↗