GPT
S

sarashina-embedding-v1-1b

קוד פתוח

sbintuitionsרישיון לא דווח2024-11-22

  • sentence-transformers
  • safetensors
  • llama
  • feature-extraction
  • transformers

זה מודל שיכוך טקסט ליפנית שמבוסס על מודל שפה של 1.2 מיליארד פרמטרים. הוא מיועד למי שצריך דיוק גבוה בחיפוש סמנטי ביפנית ומסמכים ארוכים.

  • 1.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 446,286הורדות בחודש

מה זה

המודל ממיר טקסטים לווקטורים באורך 1,792 ממדים, ומבוסס על ארכיטקטורת LlamaModel שנלקחה מהמודל Sarashina2.1-1B. הוא עבר אימון ניגודי בשני שלבים שכלל יותר מ־126 מיליון דוגמאות בשלב הראשון ועוד מעל 233 אלף דוגמאות בכוונון מפוקח. המטרה העיקרית שלו היא טיפול בטקסט יפני, בלי צורך להוסיף קידומות מיוחדות לשאילתות לפני השליחה.

במבחן הביצועים JMTEB שנערך על פני 16 מאגרי מידע שונים ביפנית, הוא עוקף מודלים מוכרים כמו text-embedding-3-large של OpenAI עם ציון ממוצע של 75.5 לעומת 74.05. היתרון הבולט מגיע במשימות שליפת מידע שבהן הוא מוביל בפער ברור, לצד תמיכה באורך מסמכים שלא אופייני לרוב מודלי השיכוך הקיימים ליפנית.

מתאים ל

  • חיפוש מסמכים ביפנית

    שליפת מידע מדויקת מתוך מאגרי טקסט ארוכים ביפנית בזכות חלון קלט גדול.

  • מערכות RAG ייעודיות ליפן

    ציון גבוה במיוחד במשימות שליפה מאפשר למצוא הקשר מדויק עבור מודל שפה.

  • סיווג וקיבוץ טקסטים

    חלוקת מאגרי תוכן גדולים לפי נושאים סמנטיים בלי צורך בהגדרת קידומות מיוחדות.

איפה זה נופל

הבעיה המרכזית שלו היא המיקוד הבלעדי כמעט ביפנית. הוא לא מיועד למערכות שמשלבות שפות נוספות באופן שוטף, ובטח לא לעברית, שבה אין לו שום יתרון מעשי. בנוסף, וקטור של 1,792 ממדים תופס נפח משמעותי בבסיסי נתונים וקטוריים ומאט את החישובים בהשוואה למודלים סטנדרטיים שמשתמשים ב־768 או 1,024 ממדים.

שאלות
נפוצות

האם המודל מתאים לעבודה עם עברית או אנגלית בלבד?

לא. המודל אומן ונבדק עבור יפנית ומבוסס על מודל שפה יפני. אין שום סיבה טכנית להעדיף אותו עבור שפות אחרות.

האם צריך להוסיף קידומת של שאילתה או מסמך לפני הטקסט?

אין צורך להוסיף שום תוספת למחרוזת. שולחים את הטקסט ישירות לפונקציית הקידוד כפי שהוא.

מה נדרש כדי להשתמש במודל בתוך אפליקציה מסחרית?

הרישיון הנוכחי אוסר שימוש מסחרי באופן ישיר. מי שמעוניין להטמיע אותו במוצר חייב לפנות לחברת sbintuitions ולהסדיר רישיון מתאים.

איך מריצים

ההרצה נעשית דרך ספריית sentence-transformers הרגילה בפייתון, והמשקל הכולל של הקבצים עומד על 4.6 גיגה-בייט בפורמט float32. כדי להריץ אותו בלי צווארי בקבוק צריך כרטיס מסך ייעודי עם לפחות 8 עד 12 גיגה-בייט של זיכרון גרפי, במיוחד אם מנצלים את מלוא אורך המסמך האפשרי.

אם כל מה שאתם צריכים זה עיבוד של כמה שורות פעם ביום, אין שום סיבה להחזיק שרת כזה פעיל, ועדיף להשתמש בפתרון ענן מרוחק. הרצה מקומית משתלמת רק כשיש נפח תעבורה שוטף שמצדיק חומרה פנימית או כשחייבים שהטקסט לא ייצא מהשרת שלכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sbintuitions/sarashina-embedding-v1-1b")
v = m.encode(["שלום עולם"])

הרישיון

המודל כפוף להסכם רישוי ייעודי לשימוש לא מסחרי של Sarashina. אי אפשר לשלב אותו במוצר שמייצר הכנסה או בשרתים מסחריים בלי לקבל אישור ורישיון מפורש מהחברה המפתחת דרך עמוד יצירת הקשר שלהם.

הרישיון המלא בעמוד המודל ↗