GPT
K

KURE-v1

קוד פתוח

nlpai-labmit2024-12-18

  • sentence-transformers
  • safetensors
  • xlm-roberta
  • sentence-similarity
  • feature-extraction

זהו מודל וקטורי ממוקד קוריאנית שעבר כוונון ייעודי לשליפת מידע. הוא מיועד למי שמחפש דיוק גבוה בקוריאנית לצד חלון הקשר ארוך בלי לעבור למודלי ענק.

  • 568Mפרמטרים
  • 8,194טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 384,187הורדות בחודש

מה זה

בבסיסו עומד bge-m3 שעבר כוונון על שני מיליון זוגות של שאילתות ומסמכים בקוריאנית עם דוגמאות שליליות קשות. הוא מייצר וקטורים בגודל 1024 ממדים ותומך בטקסטים של עד 8,192 טוקנים, מה שמאפשר להזין מסמכים ארוכים שלמים בלי לחתוך אותם לפסקאות קטנות.

במבחני ביצועים מול שמונה מאגרי בדיקה בקוריאנית, הכוללים תחומים כמו רפואה, משפטים ופיננסים, הוא הגיע למקום הראשון בדירוג הכללי. במדד Recall בתוצאה הראשונה הוא קיבל 0.526 ועקף מודלים מובילים כמו המודל המקורי שעליו הוא מבוסס, snowflake-arctic וגם את המודל של OpenAI. הפער מול bge-m3 המקורי קיים אך אינו תהומי, מה שמראה שהכוונון חידד בעיקר את הניואנסים של השפה.

מתאים ל

  • שליפת מסמכים בקוריאנית

    הוא מציג תוצאות עדיפות על פני מודלים רב-לשוניים במבחני חיפוש מבוססי קוריאנית.

  • אינדוקס קבצים ארוכים

    תמיכה ב־8,192 טוקנים מאפשרת לעבד דוחות ומאמרים שלמים בלי לחלק אותם לחלקים קטנים.

  • מנוע RAG מבוסס קוריאנית

    משמש כשלב השליפה הראשוני שמאתר את פסקאות המקור המדויקות עבור מודל שפה.

איפה זה נופל

המודל אומן ונבדק כמעט אך ורק על קוריאנית ואנגלית, ואין עליו שום נתונים לגבי עברית. למרות שהבסיס שלו מולטילינגואלי, אין סיבה להניח שהוא ישמור על איכות גבוהה בטקסט מקומי, ולא הייתי משתמש בו לשום צורך שכולל עברית. בנוסף, מדובר במודל שליפה טהור. הוא לא מייצר תשובות, לא מנמק, ולא מחליף מודל שפה גנרטיבי בתוך צינור RAG.

שאלות
נפוצות

האם המודל מתאים לחיפוש וקטורי בעברית?

לא. למרות שהבסיס המקורי מולטילינגואלי, האימון הנוסף התמקד כולו בקוריאנית. אין בדיקות שמראות איך הוא מתפקד בעברית, ולמשימות מקומיות עדיף לבחור מודלים שנבדקו ישירות על השפה.

מה ההבדל המרכזי בינו לבין KoE5 מאותה מעבדה?

ההבדל המשמעותי ביותר הוא באורך הטקסט ובביצועים. הדגם הנוכחי תומך בעד 8,192 טוקנים לעומת 512 בלבד ב־KoE5, ומשיג ציוני דיוק ושליפה גבוהים יותר בכל המבחנים שנבדקו.

איך מריצים

כדי להריץ אותו מתקינים את ספריית sentence-transformers וטוענים את המשקלים ישירות מקוד פייתון. הקבצים שוקלים כ־2.1 גיגה בייט בדיוק מלא, כך שמדובר במודל קל יחסית שרץ בקלות על כרטיס מסך ביתי בסיסי עם 8 עד 12 גיגה זיכרון, או אפילו על מעבד רגיל אם זמן התגובה פחות קריטי לכם.

היוצרים מציעים גם את KoE5, גרסה קודמת שמוגבלת ל־512 טוקנים ומבוססת על ארכיטקטורה אחרת. אם יש לכם צורך באינדוקס מסמכים ארוכים בקוריאנית, עדיף להריץ את הדגם הנוכחי מקומית במקום לשלם לפי טוקן לשירותי ענן חיצוניים, במיוחד כשהביצועים שלו עוקפים אותם על הנייר.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("nlpai-lab/KURE-v1")
v = m.encode(["שלום עולם"])

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית בתוך הקוד או החבילה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗