GPT
L

llm-embedder

קוד פתוח

BAAImit2023-10-09

  • transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל וקטורי ממוקד באנגלית שנבנה במיוחד כדי לשרת משימות אחזור שונות לצד מודלי שפה גדולים. הוא קל משקל, רץ כמעט בכל מקום ומיועד לשילוב ישיר בצינורות עבודה של שליפת מידע.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 836 MBמשקל הקבצים
  • 40,070הורדות בחודש

מה זה

המודל הזה משמש לחילוץ מאפיינים וממפה טקסט באנגלית לוקטורים צפופים. המטרה שלו, לפי המפתחים, היא לתת מענה אחוד לסוגים שונים של אחזור מידע עבור מודלי שפה, בין אם מדובר בחיפוש סמנטי, סיווג או הזנת בסיסי נתונים וקטוריים.

הבסיס כאן הוא ארכיטקטורת ברט קלאסית עם 12 שכבות וסך הכל כ־109 מיליון פרמטרים. בעוד שסדרת הדגלים הרגילה שלהם מציגה חלוקה נוקשה בין גדלים קטנים, בינוניים וגדולים שנמדדו במבחני השוואה כלליים, המודל הספציפי הזה יצא כפתרון מאוחד שמכוון ישירות לשילוב בתוך מערכות שמריצות מודלי שפה ולא סתם כמנוע דירוג טקסט בודד.

מתאים ל

  • שליפת הקשר למודלי שפה

    חיפוש קטעי מידע רלוונטיים באנגלית מתוך מאגר והעברתם ישירות כהקשר למודל השפה הגדול שלכם.

  • אכלוס בסיסי נתונים וקטוריים

    המרה של כמויות טקסט באנגלית לוקטורים מהירים שקל לחפש בהם באמצעות דמיון סמנטי.

  • סיווג וקיבוץ טקסטים

    הפקת ייצוגים מתמטיים מדויקים כדי להפריד בין קטגוריות שונות של מסמכים קצרים באנגלית.

איפה זה נופל

המגבלה הכי כואבת לפרויקטים מקומיים היא התמיכה בשפות. המודל מוגדר ומאומן לאנגלית בלבד, כך שלא תוכלו לזרוק עליו טקסטים בעברית ולצפות לתוצאות טובות. מעבר לזה, חלון ההקשר נעצר ב־512 טוקנים, מה שדורש לחתוך מסמכים ארוכים למקטעים קטנים מאוד לפני החישוב ולא מתאים לקריאת קבצים שלמים ברצף.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל הוגדר ואומן עבור השפה האנגלית בלבד. אם תזינו לתוכו טקסט בעברית, הייצוגים הוקטוריים לא יהיו מדויקים ולא יתאימו לאחזור אמין.

כמה זיכרון דרוש כדי להריץ אותו בפועל?

הקבצים שוקלים 836 מגה בייט, והמודל כולל כ־109 מיליון פרמטרים. בפועל הוא יתפוס סביב ג'יגה בייט בודד של זיכרון עבודה, כך שאפשר להריץ אותו על מחשב אישי או שרת בסיסי בלי שום חומרה מיוחדת.

איך מריצים

טוענים את המודל ישירות דרך ספריית הטרנספורמרס או דרך החבילה הייעודית של הפרויקט. עם משקל קבצים של 836 מגה בייט ודיוק נקודה צפה רגיל, הוא יושב בקלות רבה בזיכרון של כל מעבד גרפי פשוט, ואפילו על מעבד מרכזי רגיל בשרת פיתוח בלי לחנוק את המערכת.

אין סיבה אמיתית לשלם על קריאות לשירות ענן מרוחק בשביל מודל בגודל כזה. הוא קטן מספיק להרצה מקומית בתוך הקונטיינר שלכם, אלא אם אין לכם שרת ייעודי בכלל ואתם לא רוצים לנהל תשתית עצמאית.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="BAAI/llm-embedder")
print(pipe("שלום"))

הרישיון

רישיון אם איי טי פשוט ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗