GPT
P

pplx-embed-context-v1-4b

קוד פתוח

perplexity-aimit2026-01-20

  • transformers
  • onnx
  • safetensors
  • bidirectional_pplx_qwen3
  • feature-extraction

מודל שיודע לייצר וקטורים לקטעי טקסט תוך התחשבות בהקשר שמסביבם במסמך השלם. הוא חוסך את הצורך לנסח פרומפטים או הוראות מיוחדות כדי לקבל תוצאות מדויקות בשליפה.

  • 4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.0 GBמשקל הקבצים
  • 34,090הורדות בחודש

מה זה

המודל הזה מיועד למערכות RAG שבהן קוצצים מסמכים לחלקים קטנים. במקום לנתח כל פסקה בנפרד ולשכוח איפה היא הופיעה, הוא מקבל את רשימת הקטעים של המסמך ומייצר וקטור שלוקח בחשבון את המידע שסביבו.

הוא מבוסס על ארכיטקטורת Qwen3 שעברה אימון המשך בפרפלקסיטי, וכולל תמיכה בטכניקות כמו MRL ודחיסה לתוך INT8 ובינארי. בניגוד לרוב המודלים המודרניים שמחייבים אתכם לצרף הנחיה מוגדרת לטקסט כדי להוציא ממנו ביצועים טובים, כאן מוותרים על כל כאב הראש הזה ומאנדקסים את המידע ישירות, בלי לפחד ששינוי קטן בהוראה יהרוס את כל אינדקס הווקטורים שלכם.

מתאים ל

  • אינדוקס מסמכים ב־RAG

    וקטוריזציה של פסקאות בתוך מאמרים ארוכים בלי לאבד את הקשר הכללי של הטקסט שסביבן.

  • שליפה ללא פרומפטים

    מתאים למי שלא רוצה לנהל הוראות קבועות מראש וחושש ששינוי ניסוח ישבור את האינדקס.

  • חיפוש וקטורי דחוס

    ניצול תמיכה ב־INT8 ובייצוג בינארי כדי לחסוך מקום זיכרון בבסיסי נתונים וקטוריים ענקיים.

איפה זה נופל

הווקטורים שהמודל פולט מגיעים מכווצים ב־int8 ללא נירמול מראש. אם תשוו אותם במרחק אוקלידי רגיל תקבלו שטויות, וחובה לחשב דמיון קוסינוס כדי לקבל דירוג הגיוני.

בנוסף, הטעינה שלו מחייבת trust_remote_code שמאפשר הרצת קוד זר בזמן משיכת המודל. המפרט לא חושף מספרי ביצועים מפורטים בעברית או מדדי דיוק ישירים בכרטיס עצמו, כך שחייבים לבדוק בעצמכם איך הוא מתמודד עם טקסטים מקומיים לפני שמחליטים לאנדקס איתו מאגר שלם.

אותה משפחה

pplx-embed-context יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

במה הוא שונה מגרסת ה־embed הרגילה של פרפלקסיטי?

גרסת הקונטקסט מקבלת קבוצה של קטעים מאותו מסמך ומחשבת את הווקטורים תוך ראיית התמונה המלאה. הגרסה הרגילה מיועדת לשאילתות קצרות או לטקסטים עצמאיים לחלוטין שלא תלויים בפסקאות שכנות.

איך מחשבים דמיון בין וקטורים שהמודל הזה מייצר?

משתמשים אך ורק בדמיון קוסינוס. המודל מוציא ייצוג מקוונטט של int8 שאינו מנורמל, ולכן חישוב מרחק מסוג dot product רגיל או מרחק אוקלידי יחזיר תוצאות שגויות לגמרי.

איך מריצים

כדי להריץ אותו מקומית בספריית transformers צריך חומרה רצינית. משקל הקבצים עומד על 30 ג'יגה בייט והוא כולל 4 מיליארד פרמטרים וחלון הקשר של 32 אלף טוקנים, כך שתצטרכו כרטיס מסך עם לפחות 16 עד 24 ג'יגה זיכרון כדי לאנדקס טקסטים ארוכים ביעילות.

אם יש לכם שרת ייעודי ותקציב חומרה, אתם מקבלים שליטה מלאה בנתונים ובזמני התגובה. אם אין לכם את התשתית הזו או שאתם רק בודקים רעיון, פשוט תשתמשו בנקודת הקצה של פרפלקסיטי ב־API במקום לסחוב קבצים ענקיים וחישוביות כבדה בבית.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="perplexity-ai/pplx-embed-context-v1-4b")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון MIT. מותר לכם לקחת את המודל, להריץ אותו, לשנות אותו ולשלב אותו במוצר מסחרי סגור בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗