GPT
P

pplx-embed-context-v1-0.6b

קוד פתוח

perplexity-aimit2026-01-20

  • transformers
  • onnx
  • safetensors
  • bidirectional_pplx_qwen3
  • feature-extraction

מודל שיודע לייצר וקטורים למקטעי טקסט תוך התחשבות בכל המסמך שמסביב. הוא פותר את בעיית איבוד ההקשר בחיתוך מסמכים למערכות שליפה, בלי צורך בפרומפטים מעיקים.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 5.5 GBמשקל הקבצים
  • 5,640הורדות בחודש

מה זה

מערכות שליפה רגילות חותכות מסמכים למקטעים ומאבדות בדרך את ההקשר הכללי של הטקסט. הגרסה הזו נבנתה במיוחד כדי לקבל רשימות של מקטעים מתוך מסמך ולייצר לכל אחד מהם וקטור שלוקח בחשבון את המקטעים האחרים סביבו, באורך של עד 32,768 טוקנים. הבסיס שלו הוא מודל שפה של Qwen3 שעבר אימון המשך בשיטת דיפוזיה על ידי פרפלקסיטי.

ההבדל המשמעותי מול מודלים מתחרים בגודל הזה הוא הוויתור על קידומות הוראה. רוב מודלי השליפה העדכניים דורשים להדביק הוראה מיוחדת לפני הטקסט כדי להגיע לביצועים טובים, מה שמסבך את תהליך האינדוקס. כאן מכניסים את הטקסט ישירות, והוא מייצר ייצוגים של 1,024 ממדים שתומכים גם בהקטנת גודל הוקטור דרך MRL וגם בכימות לבינארי או אינט שמונה ישירות מהקופסה.

מתאים ל

  • אינדוקס מקטעים במערכות RAG

    מייצר וקטור מדויק לכל פסקה תוך שמירה על ההקשר של כל המאמר סביבה.

  • חיפוש חסכוני במשאבים

    תומך בכימות מובנה לשמונה ביט וחיפוש בינארי, מה שמקטין מאוד את נפח האחסון בראם.

  • מסמכים ארוכים ללא פרומפט

    מאנדקס חומרים של עשרות אלפי טוקנים ישירות, בלי להסתבך עם התאמת קידומות טקסט.

איפה זה נופל

הווקטורים שיוצאים מהמודל אינם מנורמלים ומגיעים בכימות מקורי של שמונה ביט. אם מסד הנתונים הווקטורי שלכם מוגדר לחשב מרחק דוט פרודקט רגיל בלי לנרמל, התוצאות יהיו משובשות לחלוטין. חייבים להשתמש בחישוב דמיון קוסינוס בלבד.

בנוסף, המודל הזה לא מיועד לשאילתות קצרות ובודדות של משתמשים. בשביל השאילתה עצמה אתם צריכים להריץ מודל מקביל מהסדרה שלא דורש הקשר מסמך, מה שאומר ניהול של שני מודלים שונים באותו פייפליין שליפה.

אותה משפחה

pplx-embed-context יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להשתמש במודל הזה כדי להמיר את שאילתת החיפוש של המשתמש?

עדיף שלא. המודל הספציפי הזה נבנה לחיתוכי מסמכים שמוזנים יחד עם שאר הטקסט שמסביבם. לשאילתות עצמאיות או חיפוש סמנטי פשוט כדאי להשתמש בגרסה הרגילה מאותה סדרה שאינה גרסת קונטקסט.

האם הוא יעבוד עם כל ספריית וקטורים קיימת?

כן, אבל רק אם מגדירים את החיפוש לפי דמיון קוסינוס. המודל מחזיר וקטורים לא מנורמלים בערכי אינט שמונה, ולכן השוואת מרחקים רגילה כמו מרחק אוקלידי תחזיר תוצאות לא נכונות.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers הרגילה בפייתון, אבל חייבים להפעיל את האפשרות להרצת קוד מרוחק כי מדובר בארכיטקטורה מותאמת אישית. מבחינת חומרה, מודל של 596 מיליון פרמטרים ששוקל 5.5 ג'יגה בייט רץ בלי בעיה על כרטיס מסך בסיסי עם 8 ג'יגה זיכרון, ואפילו על מעבד רגיל אם העומס שלכם נמוך.

אם אתם צריכים לאנדקס כמויות אדירות של מסמכים ולא רוצים להחזיק שרתים דלוקים כל הזמן, יש לו נקודת קצה ייעודית ב־API של פרפלקסיטי שמקבלת את אותם מערכים. הרצה עצמית שווה רק כשאתם חייבים שהטקסט לא ייצא מהרשת המקומית או כשיש לכם שרת עם כרטיס מסך פנוי שממילא עובד.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="perplexity-ai/pplx-embed-context-v1-0.6b")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות משוחררים תחת רישיון MIT. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להטמיע אותו במוצר שלכם בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗