GPT
N

nomic-embed-text-v2-moe-GGUF

קוד פתוח

nomic-aiapache-2.02025-04-30

  • gguf
  • sentence-similarity
  • feature-extraction
  • en
  • es

פתרון אמבדניגס מקומי וקומפקטי שמבוסס על מודל תערובת מומחים. הוא מייצר וקטורים איכותיים בשפות שונות בלי לתפוס זיכרון כבד, במיוחד דרך llama.cpp.

  • 7.4 GBמשקל הקבצים
  • 45,381הורדות בחודש
  • 79לייקים

מה זה

במקום עוד מודל אמבדינגס רגיל, המודל הזה מביא ארכיטקטורת MoE עם 475 מיליון פרמטרים בסך הכל, כשבפועל בזמן ריצה פעילים רק 305 מיליון פרמטרים דרך ניתוב של שני מומחים מתוך שמונה. הוא תומך בכיווץ וקטורים בשיטת מטריושקה ממימד של 768 עד ל־256, מה שחוסך פי שלושה בשטח האחסון בבסיס הנתונים הווקטורי בלי פגיעה חריפה בביצועים.

במדד החיפוש הרב־לשוני MIRACL הוא משיג תוצאה של 65.80, שגוברת על מודלים דחוסים בגודל דומה כמו mE5 ו־Arctic Embed v2 Base, ומתקרבת מאוד למודלים עם יותר מחצי מיליארד פרמטרים. במדד BEIR באנגלית הוא מציג 52.86, תוצאה סבירה בהחלט שעוקפת את mE5 הרגיל אבל משאירה אותו מעט מאחורי Arctic באותו גודל.

מתאים ל

  • חיפוש סמנטי למערכות RAG

    שליפת קטעי מידע קצרים ומענה לשאלות משתמשים בדיוק גבוה ובצריכת זיכרון נמוכה מאוד.

  • חיסכון באחסון וקטורי

    חיתוך האמבדינגס ל־256 ממדים מצמצם את גודל האינדקס בבסיס הנתונים פי שלושה.

  • שליפת מידע רב־לשונית

    התאמת שאילתות ומסמכים במספר שפות אירופאיות בלי צורך להחזיק מודל ענק.

איפה זה נופל

המגבלה המרכזית היא חלון קלט של 512 טוקנים בלבד. למי שמחפש לאנדקס מסמכים ארוכים שלמים, חוזים או מאמרים בלי לחתוך אותם לחתיכות קטנות מראש, הוא פשוט לא מתאים. בנוסף, חובה להוסיף קידומות ידניות לטקסט כמו search_query או search_document, ואם שוכחים את זה, איכות השליפה תתרסק. הכרטיס מודה גם שהביצועים משתנים בין שפות שונות ושדרישות המשאבים עלולות להיות גבוהות יותר ממודלים דחוסים רגילים.

אותה משפחה

nomic-embed-text-v2-moe יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא תומך בעברית בצורה טובה?

רשימת השפות הרשמית מציינת אנגלית, ספרדית, צרפתית, גרמנית, איטלקית, פורטוגזית, פולנית והולנדית. למרות שהאימון כלל שפות נוספות, עברית אינה ברשימת השפות המרכזית, ולכן לא מומלץ להסתמך עליו למסמכים בעברית בלי לבדוק אותו תחילה מול חלופות ייעודיות.

איזה קובץ GGUF הכי כדאי להוריד?

קובץ Q4_K_M בגודל 328 מגה־בייט הוא נקודת הפתיחה המומלצת שמאזנת בין דיוק למהירות. אם יש לכם מעט יותר מקום בזיכרון ותרצו איכות כמעט מושלמת, קחו את Q6_K ששוקל 379 מגה־בייט.

איך מריצים

אין צורך בשרת מפלצתי או במעבדים גרפיים יקרים. קובץ ה־GGUF המומלץ, כמו Q4_K_M או Q5_K_M, שוקל בין 328 ל־354 מגה־בייט בלבד, כך שאפשר להריץ אותו ישירות מהזיכרון של כל לפטופ מודרני באמצעות llama-server פשוט עם תמיכה באמבדינגס.

אם אתם צריכים איכות מקסימלית, קבצי ה־f16 וה־bf16 שוקלים 913 מגה־בייט, אבל גרסת Q6_K בגודל 379 מגה־בייט נותנת כמעט את אותה רמה בחצי מהנפח. להרים אותו לבד זה מהלך טבעי אם אתם עובדים מקומית, אבל אם התעבורה שלכם מבוזרת בהיקף עצום ואין לכם כוח לנהל שרתים, קיים גם שירות ב־AWS SageMaker.

ollama run hf.co/nomic-ai/nomic-embed-text-v2-moe-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר ברישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗