GPT
J

jina-embeddings-v2-small-en

קוד פתוח

jinaaiapache-2.02023-09-27

  • sentence-transformers
  • pytorch
  • coreml
  • onnx
  • safetensors

יש כאן גם סקירה על Jina AI עצמו.

מודל שיכוך טקסט קטנטן שמחזיק חלון הקשר ענק של 8,192 טוקנים. הוא פותר את הצורך לחתוך מאמרים ומסמכים ארוכים לחתיכות קטנות לפני שמייצרים מהם וקטורים.

  • 33Mפרמטרים
  • 8,192טוקנים בהקשר
  • 499 MBמשקל הקבצים
  • 927,637הורדות בחודש

מה זה

מדובר במודל של 33 מיליון פרמטרים הבנוי על ארבע שכבות בלבד. היתרון המרכזי שלו מול מודלים דומים בגודל הזה הוא היכולת לבלוע מסמך שלם באורך אלפי מילים בבת אחת, בלי לאבד את ההקשר הכללי ובלי לחייב אתכם לחלק את הטקסט למקטעים קצרים.

במדדי הדיוק של MTEB רואים שהוא מתפקד יפה מאוד במשימות דמיון סמנטי עם ציון ספירמן של מעל 80 בביוסיס, ומיון טקסטים קלאסי עובד סביר למשל 82.9% דיוק בביקורות של אמזון. מנגד, באחזור מידע מורכב הוא מתקשה. במאגרי שאילתות טכניים כמו מתמטיקה או טקס ממוצע הדיוק מגיע בקושי לאזור ה־20%, כך שהגודל הזעיר גובה מחיר כשנדרשת הבנה עמוקה של מושגים צפופים.

מתאים ל

  • אחזור מסמכים ארוכים

    שמירה על הקשר רציף במאמרים של אלפי מילים באנגלית בלי לחתוך את הטקסט לחלקים קטנים.

  • הרצה מקומית על מעבד

    ייצור וקטורים מהיר ויציב ישירות על מעבד רגיל במערכות עם תקציב חומרה נמוך.

  • סיווג טקסט ודמיון סמנטי

    זיהוי כוונות משתמש או חפיפה בין משפטים באנגלית בצריכת זיכרון של פחות מגיגה בייט.

איפה זה נופל

הוא מיועד לאנגלית בלבד, ואי אפשר להשתמש בו לטקסטים בעברית בלי לקבל תוצאות שבורות לחלוטין. ארבע שכבות ו־33 מיליון פרמטרים זה מעט מאוד כוח חישוב, ובמבחני אחזור טכניים מורכבים הוא מציג דיוק נמוך מאוד של פחות מ־15% בתוצאה הראשונה. אם אתם בונים מנוע חיפוש מסמכים מקצועי, חייבים לבדוק אותו מול הנתונים שלכם לפני שסומכים עליו.

שאלות
נפוצות

האם המודל תומך בטקסטים בעברית?

לא. המודל אומן על אנגלית בלבד והוא מתאים אך ורק לעבודה עם שפה זו. שימוש בעברית יחזיר תוצאות לא שמישות.

כמה זיכרון דרוש כדי להריץ אותו בייצור?

קבצי המודל שוקלים 499 מגה בייט, כך שפחות מגיגה בייט אחד של זיכרון עבודה יספיק לטעינה ולהרצה חלקה. אפשר להריץ אותו כמעט על כל שרת בסיסי ללא צורך בכרטיס מסך.

האם כדאי להשתמש בו למנוע RAG מורכב?

הוא מתאים בעיקר אם המסמכים ארוכים והתקציב לחומרה מוגבל. אם נדרש אחזור מדויק מאוד של פרטים טכניים, תוצאות הבנצ'מרק הנמוכות באחזור מראות שעדיף לשקול מודל גדול יותר.

איך מריצים

כדי להריץ אותו משתמשים בספריית sentence-transformers ישירות בפייתון. הקבצים שוקלים 499 מגה בייט בלבד, כך שלא צריך שרת מפלצתי או כרטיס גרפי יקר כדי להרים אותו לייצור. כל מעבד מודרני ממוצע יכול לחשב איתו וקטורים במהירות גבוהה ובצריכת זיכרון מזערית.

אין סיבה אמיתית לפנות ל־API חיצוני עבור מודל כזה. שווה להשתמש בשירות מרוחק רק אם אתם עובדים בסביבה נטולת שרת לחלוטין כמו פונקציות למדא עם מגבלות דיסק קשיחות, או כשאין לכם שום רצון לנהל תלויות של פייתון ומודלים מקומיים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("jinaai/jina-embeddings-v2-small-en")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקולות משוחררים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והפצה פנימית או מסחרית בתוך המוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗