GPT
C

Cohere-embed-english-v3.0

קוד פתוח

CohereLabsרישיון לא דווח2023-11-02

  • transformers
  • mteb
  • model-index
  • endpoints_compatible

המודל מפיק וקטורים איכותיים לטקסט באנגלית לפי תוצאות מבחני MTEB רחבים. הוא מושך מפתחים שמחפשים ביצועי אחזור וסיווג גבוהים עבור מאגרי מידע באנגלית.

  • 512טוקנים בהקשר
  • 951 KBמשקל הקבצים
  • 25,904הורדות בחודש
  • 47לייקים

מה זה

המודל משמש להמרת טקסטים באנגלית לייצוגים וקטוריים עבור משימות חיפוש סמנטי, סיווג, דירוג מחדש וחלוקה לאשכולות. בתוצאות המדידה הוא מציג דיוק גבוה מאוד בזיהוי כוונות וסנטימנט, למשל 95.61 אחוזי דיוק בסיווג ביקורות אמזון וקרוב ל־99.85 אחוזים בזיהוי שאלות כפולות. במשימות אחזור מידע הוא שומר על רמה טובה, עם ציון של 88.96 במאגר FEVER וציון 88.72 במאגר Quora, מה שמראה יכולת חזקה בהתאמת שאלות לתשובות מדויקות.

עם זאת, הביצועים שלו במבחנים מורכבים יותר מראים פערים ברורים. במשימות כמו אחזור מאמרים מדעיים ב־SCIDOCS הציון צונח ל־20.31, ובסיכום טקסטים במבחן SummEval הוא מגיע למתאם נמוך של כ־30 אחוז בלבד. המודל מתמקד נטו באנגלית, כך שהוא מתחרה ישירות במודלים ייעודיים לשפה זו ומספק תוצאות חזקות במיוחד בטקסטים קצרים ושיחות יומיומיות, אך מתקשה באחזור טכני כבד או במשימות שדורשות הבנה מעמיקה של מבנים תחביריים מפותלים.

מתאים ל

  • סינון שאלות כפולות

    מזהה כפילויות בדיוק של מעל 99 אחוז במבחני שאילתות באנגלית.

  • סיווג ביקורות וסנטימנט

    מגיע ליותר מ־95 אחוזי דיוק בזיהוי קוטביות של טקסטים באמזון.

  • מנוע חיפוש לשאלות נפוצות

    מציג תוצאות אחזור חזקות במאגרי שאלות דוגמת Quora ו־FEVER.

איפה זה נופל

הבעיה הבולטת ביותר היא היעדר משקלי המודל עצמם בנפח של 951 קילובייט, כך שאי אפשר פשוט להוריד ולהריץ אותו באופן עצמאי בלי לברר מה חסר. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים בלבד, מה שפוסל אותו לניתוח מסמכים ארוכים ללא פירוק מוקדם של הטקסט. מבחינת ביצועים, במשימות אחזור טכנולוגיות ומדעיות כמו SCIDOCS הוא מקבל ציונים חלשים מאוד סביב 20 נקודות, וסיווג רגשות בטקסט חלש עם 51.57 אחוזי דיוק. המודל לא מתאים כלל לעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת מנותק מרשת האינטרנט?

לא לפי הקבצים שמופיעים כאן. כל הקבצים שוקלים פחות ממגהבייט אחד, ולכן מדובר בהגדרות בלבד ולא במשקלי מודל שלמים שאפשר להריץ על חומרה מקומית ללא חיבור נוסף.

האם המודל יתאים לחיפוש בקטלוג מוצרים בעברית?

לא, המודל אומן והוגדר עבור השפה האנגלית בלבד, וכל המדדים בכרטיס בוחנים ביצועים באנגלית בלבד. הרצת טקסט עברי תניב תוצאות ירודות ולא שמישות.

איך מריצים

גודל הקבצים בעמוד עומד על 951 קילובייט בלבד בחלוקה לשמונה קבצים, מה שמעיד על כך שמשקלי המודל עצמם לא מאוחסנים ישירות במאגר הזה אלא רק קובצי הגדרה או מעטפת שמתחברת לתשתית של transformers. אי אפשר להריץ מודל בגודל כזה מקומית ללא הורדת המשקלים המלאים.

אם הקבצים אינם כוללים את המשקלים השלמים, השימוש המעשי מחייב קריאה לשרתי CohereLabs או משיכת המשקלים ממקור מתאים. כדי להריץ לבד תצטרכו לוודא מאיפה מורידים את שכבות הרשת, ואם מדובר רק בהפניה לענן, תצטרכו להסתמך על חיבור רשת שוטף במקום חישוב מקומי על כרטיס המסך שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="CohereLabs/Cohere-embed-english-v3.0")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 951 KB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. המשמעות ברורה, מבחינה משפטית אין אישור מפורש להשתמש בו לצרכים מסחריים, להפיץ אותו הלאה או לשלב אותו במוצר שמייצר הכנסה, וכל שימוש כזה חושף אתכם לתביעה עד שהיוצרים יפרסמו תנאים ברורים.

הרישיון המלא בעמוד המודל ↗