GPT
C

Conan-embedding-v1

קוד פתוח

TencentBACcc-by-nc-4.02024-08-22

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • mteb

פתרון וקטורי ממוקד לסינית עם תוצאות חזקות באחזור ודירוג מחדש. מתאים למי שבונה חיפוש סמנטי למסמכים קצרים בסינית ורוצה ביצועים מוכחים במבחני C-MTEB.

  • 326Mפרמטרים
  • 512טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 341,475הורדות בחודש

מה זה

מדובר במודל שיכוך טקסט מבוסס ארכיטקטורת ברט עם עשרים וארבע שכבות וכשלוש מאות עשרים וחמישה מיליון פרמטרים. המטרה הבלעדית שלו היא המרת טקסט בסינית לווקטורים עבור משימות אחזור, סיווג ודמיון סמנטי. החבילה כולה בנויה לעבודה ישירה עם ספריית sentence-transformers המוכרת.

התוצאות במדד C-MTEB מראות חוזק בולט במשימות דירוג מחדש ואחזור ממוקד. במבחן CMedQAv1 לדירוג מחדש רפואי הוא מגיע לציון מפת דיוק ממוצעת של 91.38, ובאחזור DuRetrieval הוא רושם MRR במקום הראשון של 91.75. עם זאת, במשימות סיווג כלליות כמו אמזון רוויוז התוצאות צונחות לדיוק של 50.3 אחוז בלבד, מה שמבהיר שהוא אופטימלי לחיפוש ולא לקטלוג תוכן.

מתאים ל

  • חיפוש מסמכים בסינית

    הוא מציג ציוני אחזור גבוהים במיוחד במאגרי C-MTEB של סינית.

  • דירוג מחדש לרפואה בסינית

    השיג ציון של מעל 91 אחוז במדדי דירוג מחדש למאגר השאלות CMedQA.

  • זיהוי כוונות קצרות

    מתאים לסיווג כוונות בשיחות קצרות עם 78.13 אחוזי דיוק במאגר מאסיב.

איפה זה נופל

המגבלה הקריטית ביותר היא חלון ההקשר. עם 512 טוקנים אי אפשר להזין מסמכים ארוכים, דוחות מלאים או שיחות שלמות בלי לחתוך אותם מראש לפיסקאות. שנית, המודל מיועד לשפה הסינית בלבד. אין לו תמיכה רב לשונית, הוא חסר תועלת לחלוטין לעברית או אנגלית, ובמשימות דמיון טקסט מסוימות כמו QBQTC הוא משיג ציון פירסון נמוך של 42.71.

אותה משפחה

Conan-embedding יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן והוגדר לשפה הסינית בלבד, והמדדים שלו רלוונטיים רק למאגרים בסינית. טקסט בעברית לא יעבוד כאן.

האם אפשר להטמיע אותו במוצר שנמכר לחברות?

לא, הרישיון המדווח מונע שימוש מסחרי באופן מפורש. הוא מתאים למחקר, ניסויים פנימיים או פרויקטים ללא כוונת רווח.

איך מריצים

טעינת המודל מתבצעת ישירות בקוד פייתון בעזרת sentence-transformers. משקל הקבצים עומד על 2.4 גיגה בייט בדיוק נקודה צפה שלושים ושתיים, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה זיכרון יריץ אותו בקלות רבה, ואפשר אפילו להריץ אותו על מעבד מרכזי בלי לקרוס.

אין כאן גרסאות מרובות לבחירה, אלא רק המשקלים האלה. אם כל מה שאתם צריכים זה לחפש בערימת טקסטים בסינית, עדיף להרים אותו עצמאית ולא לשלם לספקי ענן לפי קריאה, כי הדרישות החומרתיות צנועות מאוד.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("TencentBAC/Conan-embedding-v1")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא סי סי בי אן סי ארבע נקודה אפס. זה אומר שמותר להוריד, לחקור, לפתח ולהריץ לצרכים פנימיים או אקדמיים בלבד. שימוש מסחרי מכל סוג אסור לחלוטין, כך שאי אפשר להטמיע אותו במוצר שנמכר ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗