GPT
G

Giga-Embeddings-instruct

קוד פתוח

ai-sagemit2024-12-11

  • sentence-transformers
  • safetensors
  • gigarembed
  • feature-extraction
  • MTEB

מודל וקטורי מבוסס מודל שפה של 3.4 מיליארד פרמטרים, שמכוון לחיפוש סמנטי באנגלית ורוסית. הוא מקבל הוראות טקסטואליות לפני השאילתה כדי להתאים את הוקטור למשימה.

  • 3.4Bפרמטרים
  • 4,096טוקנים בהקשר
  • 12.9 GBמשקל הקבצים
  • 691,534הורדות בחודש

מה זה

המודל הזה מבוסס על מודל השפה GigaChat-3b בארכיטקטורת דקודר בלבד, עם שכבת איחוד מסוג Latent-Attention שמוציאה וקטורים בגודל 2048 ממדים. להבדיל ממודלי אימבדינג קלאסיים וקטנים, כאן מדובר במשקל כבד שמתנהג כמו מודל הנחיות. אתם מגדירים לו במילים מה אתם מחפשים או מסווגים, והוא מכוון את הוקטור לפעולה המבוקשת.

הוא אומן על שילוב של רוסית ואנגלית, עם חלון הקשר של 4,096 טוקנים. היתרון העיקרי כאן הוא הגמישות במשימות שונות כמו אחזור מידע, דמיון סמנטי או סיווג טקסטים, בלי צורך לאמן ראש ייעודי לכל משימה. המפרסמים מציינים בדיקות בנצ'מרק על RuBQ ו־MIRACL, מה שמעיד על מיקוד מובהק באחזור שאלות ותשובות בשפות היעד שלו.

מתאים ל

  • אחזור מידע באנגלית ורוסית

    מתאים למערכות RAG שמשלבות מסמכים בשפות אלו, בזכות דיוק גבוה בשאלות ותשובות שנבדק ב־RuBQ.

  • סיווג טקסטים ללא אימון

    מאפשר לסווג ביקורות או נושאים רגישים ישירות דרך הנחיה מתאימה בטקסט השאילתה.

  • בדיקת דמיון סמנטי

    מייצר וקטורים שמזהים ניסוחים שונים של אותו רעיון ברמת דיוק טובה עבור צמדי טקסטים.

איפה זה נופל

המודל תומך רשמית רק באנגלית וברוסית, כך שחיפוש בעברית לא נתמך ולא יניב תוצאות עקביות. בנוסף, חלון ההקשר מוגבל קשיחה ל־4,096 טוקנים, וטקסט ארוך מזה פשוט לא יעבוד. החיסרון התפעולי הגדול הוא החובה לנסח הוראה ספציפית לכל שאילתה. אם תשלחו שאילתה ישירה בלי תבנית ההנחיה, איכות הוקטורים והאחזור תרד משמעותית. המפתחים גם מציינים שגרסאות שונות של ספריות הבסיס מייצרות שינויים קלים בתוצאות.

שאלות
נפוצות

האם חובה להוסיף הנחיה לכל טקסט שמאנדקסים?

לא. ההנחיה מיועדת אך ורק לשאילתות החיפוש או למשימות סימטריות כמו השוואת משפטים. המסמכים שנשמרים במאגר מאונדקסים כמו שהם, בלי שום הוראה מקדימה.

האם המודל יתאים לחיפוש מסמכים בעברית?

המודל אומן על רוסית ואנגלית בלבד. אין לו תמיכה רשמית בעברית, ולכן הוא לא מתאים למאגרים מקומיים שדורשים הבנה של השפה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־12.9 ג'יגה בייט בפורמט float32. כדי להריץ אותו מקומית עם sentence-transformers או Hugging Face בצורה יעילה תצטרכו כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון וידאו, במיוחד אם תרצו לנצל את מלוא חלון ההקשר ותעבדו עם flash-attn.

אם אתם צריכים רק וקטורים פשוטים לאנגלית או שאין לכם חומרה ייעודית בשרת, להחזיק מודל כזה באוויר יעלה לא מעט כסף ומשאבים. במקרים כאלה עדיף לפנות ל־API חיצוני או למודלים קטנים בהרבה, אלא אם המידע שלכם רגיש וחייב להישאר אצלכם.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("ai-sage/Giga-Embeddings-instruct")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות היא חופש פעולה כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהריץ אותו בכל תשתית, כל עוד משאירים את הצהרת זכויות היוצרים המקורית של ai-sage.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗