GPT
B

BGE-m3-ko

קוד פתוח

dragonkueapache-2.02024-09-17

  • sentence-transformers
  • safetensors
  • xlm-roberta
  • sentence-similarity
  • feature-extraction

גרסה מותאמת לקוריאנית של מודל שיכוך וקטורי מבוסס XLM-Roberta. הוא מייצר וקטורים צפופים באורך 1024 עבור אחזור מסמכים, מיון וחיפוש סמנטי במסמכים ארוכים.

  • 568Mפרמטרים
  • 8,194טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 81,306הורדות בחודש

מה זה

הבסיס המקורי סובל מביצועים חלשים בשפות שאינן אנגלית או סינית, ולכן היוצר אימן אותו מחדש על נתונים בקוריאנית. המודל ממיר פסקאות וטקסטים לוקטור יחיד תוך שימוש בדמיון קוסינוס להשוואה. הוא כולל תמיכה באנגלית ובקוריאנית, ומיועד למשימות דמיון טקסטואלי, סיווג וחיפוש סמנטי.

בבנצ'מרק הקוריאני של AutoRAG, שמתמקד בטקסטים ארוכים ובעולם הפיננסי, הוא הגיע לציון 0.7456 ב־NDCG בתוצאה הראשונה. מדובר בשיפור ניכר מול דגמים כמו OpenAI embed 3 large שהשיג 0.6053 ומול דגם הבסיס BGE-m3 שעמד על 0.6578. בבדיקות של עשר תוצאות ראשונות הוא החזיר 0.9736 ב־Recall, כלומר כמעט תמיד מוצא את המסמך הרלוונטי ברשימה.

מתאים ל

  • חיפוש מסמכים פיננסיים

    מצטיין באחזור טקסטים ארוכים בתחום הכלכלי בקוריאנית, כפי שהוכח בבנצ'מרק של AutoRAG.

  • בניית אינדקס למערכות RAG

    מפיק וקטורים צפופים שמביאים תוצאות מדויקות עם Recall של מעל 97 אחוזים בעשר התוצאות המובילות.

  • סיווג וקיבוץ פסקאות

    ממפה קטעי טקסט ארוכים למרחב של 1024 ממדים לצורך זיהוי כפילויות וחלוקה לקטגוריות.

איפה זה נופל

המודל מציג ירידה בביצועים כשהוא נתקל בטקסטים קצרים. במבחן miracl-ko שמבוסס על ויקיפדיה הקוריאנית עם מחרוזות קצרות, מדד ה־NDCG שלו ירד ב־0.02 נקודות בעקבות האימון הנוסף. בנוסף, הוא מוגדר לשפות אנגלית וקוריאנית בלבד. אם יש לכם טקסטים בעברית, אין מה לחפש כאן, הוא פשוט יחזיר וקטורים חסרי משמעות. היוצר עצמו מבהיר שחובה לבחון את המודל על הדאטה הספציפי שלכם לפני פריסה.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

לא. המודל אומן והותאם ספציפית לקוריאנית ואנגלית, ואין לו תמיכה סמנטית בעברית.

למה להעדיף אותו על פני ה־BGE-m3 המקורי?

אם המערכת שלכם מעבדת קוריאנית באורך בינוני עד ארוך, האימון הנוסף משפר את איכות הדירוג והאחזור במידה מורגשת.

איך מריצים

טוענים את המשקלים ישירות דרך ספריית sentence-transformers בפייתון באמצעות פקודת התקנה פשוטה. הקבצים שוקלים 2.1 גיגה בייט, כך שאפשר להעלות אותם בקלות לכרטיס מסך ביתי מודרני עם שמונה גיגה זיכרון, או אפילו להריץ על מעבד רגיל אם השיהוי פחות קריטי לכם.

אם אתם צריכים לאנדקס כמויות קטנות או לבצע חיפושים פנימיים, אין שום סיבה לשלם לספקי ענן חיצוניים על קריאות API. הרצה עצמית שומרת על המידע שלכם בתוך הרשת המקומית וחוסכת עלויות שוטפות, במיוחד כשיש תעבורה קבועה וגבוהה של שאילתות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("dragonkue/BGE-m3-ko")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בתוך הקוד או ההפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗