GPT
I

instructor-base

קוד פתוח

hkunlpapache-2.02022-12-20

  • sentence-transformers
  • pytorch
  • t5
  • text-embedding
  • embeddings

מודל שיודע לייצר וקטורים לפי הוראות טקסטואליות עבור משימות חיפוש וסיווג באנגלית. הוא שוקל פחות מחצי ג'יגה ורץ בקלות על כל שרת בסיסי.

  • 512טוקנים בהקשר
  • 424 MBמשקל הקבצים
  • 34,649הורדות בחודש
  • 120לייקים

מה זה

המודל מתבסס על ארכיטקטורת T5EncoderModel ומפיק ייצוגים וקטוריים לטקסט תוך התאמה להוראות מפורשות שאתם מספקים לו, כמו הגדרת סוג המסמך או מטרת החיפוש. בבדיקות מדד MTEB הוא הציג ביצועים מעורבים. בסיווג פולאריות באמזון הוא הגיע לדיוק של 88.35 אחוז, ובמשימות דמיון סמנטי כמו BIOSSES הציג מתאם ספירמן של 82.3. לעומת זאת, במשימות אחזור מורכבות יותר מתוך CQADupStack, למשל בתחום המתמטיקה, מדד map בתוצאה הראשונה עמד על 16.92 בלבד.

ההבדל המרכזי מול מודלים רגילים באותו סדר גודל הוא היכולת לכוונן את הווקטור באמצעות שורת הנחיה בלי לאמן את המשקולות מחדש. במקום להסתפק בהשוואת טקסט מול טקסט, אתם מגדירים למודל אם לחפש שאלה דומה, לסווג נושא או לאחזר תשובה טכנית.

מתאים ל

  • אחזור שאלות טכניות באנגלית

    במדד AskUbuntu הוא הגיע ל־MRR של 76.18, מה שמבטיח דיוק טוב בחיפוש בעיות תכנות דומות.

  • סיווג פניות תמיכה פיננסיות

    הוא השיג דיוק של מעל 77 אחוז במאגר Banking77 ומתאים למיון ראשוני של פניות שירות.

  • חיפוש סמנטי מקומי וזול

    משקל של 424 מגה בייט מאפשר לו לרוץ בתוך שרת קיים בלי צורך בכרטיס מסך יקר.

איפה זה נופל

הבעיה הבולטת ביותר היא חוסר תמיכה בעברית. המודל אומן והוגדר לאנגלית בלבד, וניסיון להזין לו טקסט ישראלי מקומי ייתן תוצאות לא שמישות. מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים, מה שפוסל אותו לעיבוד מסמכים משפטיים ארוכים, מאמרים מלאים או תיעוד טכני נרחב בלי לחתוך אותם קודם לפסקאות קצרות. בתוצאות הסיווג של ביקורות אמזון המרובות הוא נעצר על 44.64 אחוזי דיוק בלבד, כך שבמשימות טקסט מורכבות בעלות ריבוי מחלקות הוא נוטה לפספס.

שאלות
נפוצות

האם המודל תומך בשפה העברית?

לא. הכרטיס מציין אנגלית בלבד. אם תזינו עברית תקבלו וקטורים באיכות נמוכה שלא ישקפו את המשמעות של הטקסט.

האם צריך כרטיס מסך כדי להשתמש בו בייצור?

אין צורך בכרטיס מסך ייעודי. גודל הקבצים הוא 424 מגה בייט בלבד, והוא רץ בקלות גם על מעבד רגיל של שרת ענן פשוט.

האם אפשר להשתמש בו במוצר מסחרי?

כן. המודל שוחרר תחת רישיון apache-2.0 שמאפשר שימוש מסחרי, שינוי והפצה, בכפוף לשמירה על תנאי הרישיון והקרדיט המקורי.

איך מריצים

אתם טוענים את הקבצים ישירות דרך ספריית sentence-transformers או transformers הרגילה בפייתון. הקבצים שוקלים 424 מגה בייט בלבד, כך שלא צריך מעבד גרפי ייעודי ואפשר להריץ אותו ישירות על מעבד של שרת ענן פשוט, מחשב נייד או מכולת דוקר קטנה.

אם אתם צריכים לאנדקס מאגרים קטנים עד בינוניים או לבצע בדיקות פנימיות בלי לשלוח נתונים החוצה, הריצה המקומית עובדת מצוין. אם אתם מעבדים עשרות מיליוני מסמכים בשעה ואין לכם תשתית סקיילינג למעבדים, שירות מנוהל חיצוני יחסוך את כאב הראש התפעולי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("hkunlp/instructor-base")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה כמעט מלא. אתם רשאים להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו ללקוחות בלי לשלם תמלוגים, כל עוד אתם משאירים את הצהרת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗