GPT
E

ember-v1

קוד פתוח

llmrailsmit2023-10-10

  • sentence-transformers
  • pytorch
  • safetensors
  • bert
  • feature-extraction

מודל שיכוך טקסט מבוסס BERT שמיועד לחילוץ מאפיינים וחיפוש סמנטי באנגלית. הוא מציע פשרה טובה בין דיוק חיפוש לגודל של 335 מיליון פרמטרים.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 3,474הורדות בחודש

מה זה

מדובר במודל שמייצר וקטורים מייצגים לטקסט באנגלית, ומבוסס על ארכיטקטורת BERT עם עשרים וארבע שכבות. הוא נבנה עבור משימות דמיון סמנטי, אחזור מידע, סיווג וקיבוץ טקסטים. המודל שוקל 2.5 גיגה בייט ומיועד לעבודה ישירה עם ספריית המשפטים המוכרת sentence-transformers, כך שהשילוב שלו בצנרת קיימת דורש כמה שורות קוד בודדות.

במבחני MTEB הרשמיים שנמדדו עבורו הוא מציג תוצאות מעורבות. בסיווג פולאריות של ביקורות הוא פוגע יפה עם דיוק של 91.97%, ובסיווג כוונות בנקאיות הוא מגיע לדיוק של 87.89%. גם בדמיון סמנטי רפואי הוא מציג מתאם ספירמן של מעל 85 נקודות. עם זאת, במבחני סיווג רב מחלקתי כמו ביקורות מדורגות הוא צונח לדיוק של 47.93%, ובמשימות אחזור טכניות מסובכות כמו מתמטיקה או תכנות הציון שלו יורד לאזור ה־20 עד 30 נקודות בלבד. זה אומר שהוא מזהה כיוון כללי מצוין, אבל מתקשה בניואנסים מקצועיים עמוקים.

מתאים ל

  • חיפוש שאלות ותשובות

    מנוע אחזור לשאלות דומות בפורומים טכניים, תחום שבו הוא הציג ציון MRR של 77.8 במבחני אימות.

  • סיווג פניות תמיכה

    מיון אוטומטי של פניות נכנסות באנגלית, בזכות דיוק של 87.89% שהפגין על נתוני שיחות בנקאיות.

  • סינון סנטימנט בביקורות

    זיהוי גישה חיובית או שלילית בטקסטים קצרים של משתמשים, משימה שבה עבר 91% דיוק בבדיקות.

איפה זה נופל

הבעיה המרכזית היא חלון ההקשר, שנעצר ב־512 טוקנים. אי אפשר לדחוף אליו מסמכים שלמים, חוזים ארוכים או מאמרים בלי לפצל אותם מראש לפסקאות קצרות. בנוסף, המודל מאומן על אנגלית בלבד. אם תזינו לו עברית תקבלו תוצאות חסרות משמעות, כי הוא לא מכיר את השפה ולא מיועד לה. הנתונים מראים גם חולשה ברורה באחזור של מושגים טכניים מורכבים, שם אחוזי הדיוק שלו נמוכים בהרבה מהממוצע.

שאלות
נפוצות

האם אפשר להשתמש במודל עבור מסמכים בעברית?

לא, המודל תומך באנגלית בלבד. הרצה שלו על טקסט עברי תייצר וקטורים אקראיים שלא משקפים משמעות אמיתית. אם אתם צריכים עבודה עם עברית, חפשו מודל רב לשוני.

כמה זיכרון דורשת הרצה שלו בפרודקשן?

הקבצים שוקלים 2.5 גיגה בייט, כך שכרטיס מסך עם 6 גיגה בייט של זיכרון יספיק לעבודה שוטפת ומהירה. אפשר להריץ אותו גם על מעבד רגיל, אך קצב עיבוד הטוקנים יהיה איטי משמעותית.

איך מריצים

כדי להריץ אותו צריך זיכרון וידאו צנוע של 4 עד 6 גיגה בייט בלבד, מה שאומר שהוא רץ בלי מאמץ על כרטיס מסך בסיסי כמו RTX 3060, ואפילו על מעבד סביר אם מוכנים לספוג זמני תגובה איטיים יותר. אין כאן גרסאות מכווצות או משקלים שונים בחבילה, אלא קובצי המשקל המקוריים בדיוק float32 שנפרסים על 13 קבצים.

אם אתם צריכים לאנדקס מיליוני מסמכים בבת אחת, תצטרכו מכונה ייעודית עם מאיץ כדי לקבל זמני חישוב סבירים. לעומת זאת, אם השימוש שלכם הוא סריקת כמה מאות שאילתות ביום, להקים עבורו שרת ייעודי בענן יעלה יותר מאשר לשלוח את הטקסט לשירותי וקטורים מוכנים שגובים שברירי אגורות לפי שימוש.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("llmrails/ember-v1")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקלים שוחררו תחת רישיון MIT. המשמעות היא חופש פעולה מלא, כולל שימוש מסחרי, שינוי הקוד, הטמעה במוצרים סגורים ומכירה שלהם, בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של המפרסמים במקורות שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗