GPT
C

cde-small-v1

קוד פתוח

jxmרישיון לא דווח2024-09-24

  • sentence-transformers
  • safetensors
  • feature-extraction
  • mteb
  • transformers

מודל שיכוך טקסט קומפקטי שמיועד לחילוץ מאפיינים וחיפוש סמנטי. הוא פונה למי שמחפש מודל מקומי קל משקל בלי להעמיס על הזיכרון.

  • 281Mפרמטרים
  • 1.0 GBמשקל הקבצים
  • 194הורדות בחודש
  • 284לייקים

מה זה

הארכיטקטורה מבוססת על DatasetTransformer עם 281 מיליון פרמטרים, והוא מתמקד במשימות של אחזור מידע, סיווג ודירוג מחדש. המטרה שלו היא לייצר וקטורים איכותיים לטקסט תוך שמירה על משקל קובץ של גיגה בייט בודד. הוא נבנה לעבודה ישירה עם sentence-transformers, כך שהשילוב בקוד קיים דורש מעט מאוד מאמץ.

במבחני MTEB התוצאות מראות פערים ברורים בין סוגי המשימות. בסיווג פולאריות באמזון הוא מגיע לדיוק של 94.66 אחוז, ובמשימת ArguAna הוא רושם NDCG ב־10 של כמעט 72 נקודות, שזה נתון יציב למדי למודל בגודל כזה. לעומת זאת, בסיווג ביקורות רב-דרגתי הוא צונח ל־55.76 אחוז, מה שאומר שבדקויות מורכבות יותר הוא מתקשה להבחין.

מתאים ל

  • חיפוש סמנטי באנגלית

    מתאים לשליפת מסמכים לפי משמעות תודות לציון NDCG של 72 נקודות באחזור.

  • סיווג טקסט בינארי

    מציג דיוק של 94.66 אחוז בזיהוי פולאריות, מה שהופך אותו ליעיל במיון בסיסי.

  • דירוג תוצאות מחדש

    מגיע למדד MRR של 74.49 במאגר AskUbuntu, מה שמסייע בסידור שאלות דומות.

איפה זה נופל

החולשה העיקרית מופיעה במשימות סיווג מורכבות, כפי שמשתקף בציון הנמוך בביקורות אמזון. בנוסף, המבחנים שפורסמו מתמקדים כולם בשפה האנגלית, ואין שום תיעוד או ערבויות ליכולת שלו להתמודד עם עברית. הנתונים לא מפרטים תמיכה רב-לשונית, ולכן שימוש בו לטקסט מקומי ידרוש בדיקה יסודית מראש.

אותה משפחה

cde-small יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו לפרויקט חדש?

עדיף לבדוק קודם את cde-small-v2. בעמוד המודל מצוין במפורש שקיימת גרסה שנייה וחדשה יותר, ולרוב אין סיבה להישאר עם הגרסה הראשונה אלא אם יש אילוץ תאימות נקודתי.

האם המודל מתאים לטקסטים בעברית?

אין שום אינדיקציה לכך בנתונים. כל מבחני הביצועים והמדדים נערכו על מאגרים באנגלית בלבד. אם תריצו עליו עברית בלי לבדוק את איכות הווקטורים בעצמכם, אתם לוקחים הימור.

איך מריצים

טעינת המודל נעשית ישירות דרך ספריית sentence-transformers הרגילה בפייתון. הקבצים שוקלים כגיגה בייט אחד בפורמט float32, כך שאין שום צורך בכרטיסי מסך מפלצתיים. אפשר להריץ אותו בקלות על מעבד רגיל, או על כרטיס מסך בסיסי עם 2 עד 4 גיגה זיכרון פנוי לעיבוד מהיר במנות.

המפתח כבר שחרר גרסה חדשה יותר בשם cde-small-v2, ולכן אם אתם מקימים פרויקט חדש כדאי לבדוק אותה קודם. להרצה מקומית יש כאן יתרון פרטיות מובהק ומחיר אפסי, אבל אם אין לכם תשתית שרתים יציבה, קריאה ל־API חיצוני תחסוך את כאב הראש של התחזוקה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("jxm/cde-small-v1")
v = m.encode(["שלום עולם"])

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. במצב כזה ברירת המחדל המשפטית היא שכל הזכויות שמורות, מה שאומר שאסור לשלב אותו במוצר מסחרי או להפיץ אותו מחדש בלי אישור מפורש ממי שהעלה אותו.

הרישיון המלא בעמוד המודל ↗