GPT
Z

zembed-1-embedding

קוד פתוח

zeroentropyapache-2.02026-03-02

  • sentence-transformers
  • safetensors
  • qwen3
  • finance
  • legal

מודל שיקוע של ארבעה מיליארד פרמטרים שמציג ביצועים עדיפים על מודלים קנייניים בתחומים מקצועיים. הוא נועד למי שרוצה אחזור מדויק בלי לשלם לפי טוקן לחברות ענן.

  • 4Bפרמטרים
  • 40,960טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 9,958הורדות בחודש

מה זה

המודל הזה מבוסס על Qwen3 בגודל 4B, והוא עוצב כמודל אחזור וייצוג טקסט רב לשוני. הוא עבר זיכוך ממודל דירוג מחדש באמצעות שיטה שמודדת רלוונטיות כציוני אלו, במקום אימון ניגודי פשוט על תוויות של כן ולא. בנוסף, הוא תומך בהקטנת מימדים מובנית מ־2560 ועד ל־40, כולל קוונטיזציה בינארית לדחיסת וקטורים לנפח קטן במיוחד.

במדדי NDCG@10 שהמפתחים פרסמו, הוא עוקף מודלים סגורים כמו של OpenAI ו־Cohere במיוחד בתחומי רפואה, משפט, שיחות ופיננסים. המשמעות בפועל היא יכולת טובה יותר להבין שאלות מורכבות ומסמכים ארוכים בנישות מקצועיות, אם כי בחיפוש רשת כללי הוא דווקא הציג תוצאות נמוכות יותר מחלק מהמתחרים.

מתאים ל

  • אחזור מסמכים משפטיים

    המודל הציג ציון של 0.6723 בתחום המשפטי, גבוה משמעותית מכל מתחרה שנבדק.

  • חיפוש בתיקים רפואיים

    תוצאות עדיפות במסמכי רפואה לעומת מודלים קנייניים מובילים.

  • מערכות עם אילוצי אחסון

    תמיכה מובנית בחיתוך מימדים עד ל־40 ודחיסה בינארית לחסכון במקום.

איפה זה נופל

החיסרון הבולט בטבלאות הביצועים הוא חיפוש רשת כללי, שבו המודל קיבל ציון של 0.6165 לעומת 0.7242 של Cohere ו־0.6750 של OpenAI. בנוסף, הכרטיס מצהיר על אימון רב לשוני רחב אך לא מפרט אילו שפות נכללו ובאיזה היקף, כך שאי אפשר לדעת מראש איך הוא מתמודד עם עברית בלי לבדוק בפועל. יש גם חוסר עקביות בכרטיס לגבי אורך ההקשר, כשבמקום אחד מצוין 32k ובמקום אחר מעל 40k טוקנים.

שאלות
נפוצות

איך המודל מתמודד עם עברית?

החברה מציינת שיותר ממחצית מנתוני האימון היו בשפות שאינן אנגלית, אך אין רשימת שפות רשמית או תוצאות מבחן ייעודיות לעברית. תצטרכו להריץ בדיקה על מדגם נתונים שלכם כדי לוודא שאיכות השיקוע מספקת.

האם כדאי להקטין את מימדי הווקטור?

היכולת להוריד מ־2560 מימדים עד ל־40 חוסכת נפח עצום בבסיס הנתונים הווקטורי. עם זאת, היוצרים מציינים שיש פגיעה מסוימת בדיוק ככל שדוחסים, ולכן כדאי למדוד את הפגיעה באיכות האחזור מול החיסכון במשאבים.

איך מריצים

במשקל קבצים של 7.5 גיגה בייט בדיוק bfloat16, תצטרכו כרטיס מסך עם לפחות 16 גיגה זיכרון כדי לטעון אותו, ולמעשה 24 גיגה ומעלה אם אתם מתכוונים לנצל את חלון ההקשר המלא שמגיע לעשרות אלפי טוקנים. הוא נתמך ישירות בספריית sentence-transformers, כך שהשילוב בקוד פייתון קיים הוא עניין של שורות בודדות.

אם אתם לא רוצים לנהל שרתים עם חומרה ייעודית בשביל לייצר וקטורים, היוצרים מציעים גם נקודת קצה של API בתשלום. שרת עצמאי שווה את הטרחה רק כשאתם חייבים שהמידע לא ייצא מהרשת שלכם, או כשנפח השאילתות כל כך גבוה שעלויות הקריאות החיצוניות יקרות מדי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("zeroentropy/zembed-1-embedding")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקולות ושילוב במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗