GPT
N

nomic-embed-text-v1.5-GGUF

קוד פתוח

nomic-aiapache-2.02024-02-14

  • gguf
  • feature-extraction
  • sentence-similarity
  • en

גרסת GGUF יעילה לייצור וקטורים שמיועדת להרצה מקומית דרך llama.cpp. היא מתאימה למי שרוצה חלון של 8192 טוקנים בקבצים ששוקלים מגה-בייטים בודדים.

  • 1.7 GBמשקל הקבצים
  • 144,478הורדות בחודש
  • 133לייקים

מה זה

הקבצים האלה מספקים מימושים מכווצים של מודל וקטורי פופולרי שנועד למשימות דמיון בין טקסטים. הוא בנוי לעבודה מהירה ישירות מתוך llama.cpp, כשהייחוד שלו הוא היכולת לטפל במסמכים ארוכים פי כמה מרוב החלופות בגדלים האלה.

המשקלים נעים בין 48 MiB בגרסת Q2_K המצומצמת ועד 262 MiB בגרסת f16 המלאה. נתוני ה־MSE מראים שהקוונטיזציה של Q8_0 שומרת על שגיאה נמוכה של 5.79e-06 מול המקור, בעוד שרמות כיווץ אגרסיביות כמו Q2_K כבר קופצות לשגיאה של 2.33e-03, כך שרווח הנפח שם מגיע על חשבון דיוק הייצוג.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    הוא תומך בעד 8192 טוקנים, ולכן מתאים לאינדוקס פסקאות מורכבות בלי לחתוך אותן.

  • שליפת מידע במערכות RAG

    משתמשים בקידומת search_query כדי לקודד שאלות משתמש ולשלוף מול מאגר וקטורי.

  • הרצה על ציוד קצה מקומי

    הגרסאות המכווצות שוקלות עשרות מגה-בייטים בודדים ורצות בקלות על מעבד רגיל.

איפה זה נופל

המגבלה המרכזית היא הצורך להדביק ידנית קידומת ייעודית לכל טקסט, למשל search_query לפני שאלות חיפוש, כדי שהמודל יבין מה התפקיד שלו. אם תשכחו את הקידומת, איכות השליפה תיפגע.

בנוסף, המודל אומן ותועד רק באנגלית. הוא לא נבדק רשמית על עברית ולא מיועד לה, ובשילוב היעדר תמיכה של המנוע המקומי בשיטת Dynamic NTK-Aware RoPE המקורית, חובה לבדוק את התנהגות ההקשר הארוך לפני שסומכים עליו.

אותה משפחה

nomic-embed-text יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסת קוונטיזציה הכי כדאי להוריד?

עבור רוב השימושים Q4_K_M או Q8_0 מספקות איזון נכון. בגרסת Q4_K_M מקבלים קובץ של 81 MiB עם שגיאת MSE נמוכה יחסית, בעוד שגרסאות קיצוניות כמו Q2_K מאבדות יותר מדי מידע.

למה המודל לא מנתח את כל המסמך הארוך כברירת מחדל?

הקובץ נטען ב־llama.cpp עם מגבלה של 2048 טוקנים מראש. כדי לפתוח את מלוא 8192 הטוקנים צריך להוסיף לפקודת ההרצה את הגדרות ההרחבה המתאימות.

איך מריצים

מריצים אותו בפקודה פשוטה מול הקובץ הבינארי של llama.cpp בלי צורך בכרטיס מסך מפלצתי. כל מחשב פיתוח ממוצע עם מעבד בסיסי יכול להחזיק בזיכרון קובץ של 81 MiB או 140 MiB ולחשב וקטורים במהירות.

מי שמשתמש ב־llama.cpp מקבל כברירת מחדל חלון של 2048 טוקנים. כדי להגיע לניצול מלא של 8192 טוקנים צריך להגדיר הרחבת הקשר באמצעות yarn בדגלי ההרצה. שווה להחזיק שרת עצמאי אם יש לכם זרם חיפושים מתמיד או רגישות לפרטיות, אבל אם אתם שולחים שאילתה פעם בשעה עדיף לשלם לפי קריאה לשרת מרוחק.

ollama run hf.co/nomic-ai/nomic-embed-text-v1.5-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פרטיים ולחלק עותקים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗