GPT
S

snowflake-arctic-embed-l-v2.0-ko

קוד פתוח

dragonkueapache-2.02025-03-07

  • sentence-transformers
  • safetensors
  • xlm-roberta
  • sentence-similarity
  • feature-extraction

מודל וקטורי מבוסס Arctic של סנואופלייק שעבר אימון ייעודי לקוריאנית. מי שבונה מנוע חיפוש או RAG עבור מסמכים בקוריאנית ומחפש דיוק גבוה ירצה לבדוק אותו.

  • 568Mפרמטרים
  • 8,194טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 94,129הורדות בחודש

מה זה

זהו מודל וקטורי מבוסס XLM-RoBERTa עם 568 מיליון פרמטרים, שנלקח מהבסיס של Snowflake ואומן מחדש על קבוצות נתונים מגוונות מקוריאה. הוא ממיר משפטים ופסקאות לווקטורים צפופים באורך 1024 ממדים, ומיועד למשימות דמיון טקסטואלי ואחזור מידע סמנטי. האימון הנוסף התבסס על מאגרי AI Hub בתחומי משפט, מנהל ציבורי, פיננסים וספרות.

במבחני ביצועים בקוריאנית תחת תקן MTEB המודל מציג ממוצע של 0.740 במדד NDCG@10, ומנצח חלופות מוכרות כמו BGE-M3 ופתרונות מסחריים כמו text-embedding-3-large של OpenAI. היתרון הבולט שלו מתבטא במסמכים ספציפיים לתעשייה ובשאלות מורכבות, ולא רק בטקסטים כלליים מוויקיפדיה. בנוסף, המודל הותאם לחפש בתוך טבלאות מרקדאון ולזהות שאילתות קצרות שמבוססות על ביטויים בלבד.

מתאים ל

  • אחזור מסמכים מנהליים

    הוא אומן ישירות על נתוני ממשל ומשפט בקוריאנית ומציג 0.909 במבחן AutoRAG.

  • חיפוש בטבלאות נתונים

    עבר התאמה מיוחדת לשליפת תשובות מתוך טבלאות בפורמט מרקדאון במסמכים טכניים.

  • מנועי חיפוש לשאילתות קצרות

    מטפל היטב בחיפושים המבוססים על ביטויים ספורים ולא רק על משפטים תחביריים שלמים.

איפה זה נופל

למרות שארכיטקטורת הבסיס תומכת בחלון הקשר של 8,194 טוקנים, האימון הנוכחי הוגבל במכוון לאורך של 1300 טוקנים כדי לחסוך עלויות חישוב. אם תנסו לאחזר מסמכים ארוכים שעוברים את הרף הזה, בערך 2500 תווים בקוריאנית, הביצועים יורדים באופן משמעותי. במבחן MultiLongDocRetrieval המודל מקבל ציון 0.4459, ונשאר מאחורי מודלים כמו gte-multilingual-base ששומרים על יציבות בטקסט ארוך.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או בשפות אחרות?

הבסיס מגיע ממודל רב לשוני, אבל כל האימון הייעודי כאן התמקד בקוריאנית ובאנגלית בלבד. לא הייתי בונה עליו לשום שפה אחרת, ועבור עברית עדיף לקחת מודל רב לשוני כללי כמו bge-m3 או פתרון ייעודי.

האם כדאי להשתמש בו לחיפוש בקבצי PDF שלמים?

רק אם חותכים את המסמך לפסקאות קצרות מראש. בגלל שהאימון נעצר ב־1300 טוקנים, דחיפה של מסמכים ארוכים לתוך הווקטור תפגע באיכות השליפה, ובמקרה כזה עדיף מודל שמיועד למסמכים מלאים.

איך מריצים

טוענים את המודל ישירות דרך ספריית sentence-transformers יחד עם חבילת xformers. קובצי המודל שוקלים 2.1 גיגה בייט, ובזמן ריצה הוא תופס סביב 3 עד 4 גיגה בייט של זיכרון וידאו על כרטיס גרפי, כך שכל מעבד גרפי מודרני ברמת כניסה מריץ אותו בלי מאמץ.

אפשר להריץ אותו גם על מעבד רגיל עבור נפחי תעבורה נמוכים, אבל החיפוש יהיה איטי יותר. אם אין לכם תשתית ענן עם כרטיסים גרפיים או שאתם מחפשים פתרון אפס תחזוקה לשאילתות בודדות ביום, עדיף להשתמש במודל מסחרי דרך ממשק תכנות.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("dragonkue/snowflake-arctic-embed-l-v2.0-ko")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי חופשי, שינוי של המשקלים והטמעה במערכות פנימיות או במוצרים חיצוניים. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗