GPT
P

pplx-embed-v1-0.6b

קוד פתוח

perplexity-aimit2026-01-14

  • sentence-transformers
  • onnx
  • safetensors
  • bidirectional_pplx_qwen3
  • feature-extraction

מודל שיכוך צפוף בגודל חצי מיליארד פרמטרים שמחזיר וקטורים מכווצים של 1024 ממדים. הוא מדלג על הנחיות טקסט מורכבות ומאפשר לבנות חיפוש סמנטי מהיר מאוד בלי לשבור את הראש.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 5.5 GBמשקל הקבצים
  • 45,574הורדות בחודש

מה זה

מדובר במודל שיכוך מבית פרפלקסיטי שמבוסס על ארכיטקטורת Qwen3 ועבר אימון מקדים בשיטת דיפוזיה. הוא מיועד לייצוג טקסטים שלמים, שאילתות ומסמכים עבור מנועי חיפוש ושליפה, עם תמיכה בריבוי שפות וחלון הקשר נדיב של 32,768 טוקנים. היתרון הגדול שלו מול רוב המודלים בגודל הזה טמון בוויתור המכוון על תחיליות הנחיה. בעוד מודלים מתחרים דורשים להדביק פקודות ספציפיות לפני כל שאילתה כדי לקבל תוצאות טובות, כאן מעבירים את הטקסט ישירות כפי שהוא, מה שחוסך כאבי ראש ותחזוקה במערכות אינדוקס.

המודל מייצר וקטורים עם כימות טבעי לפורמט int8 או בינארי, ותומך בטכניקת MRL שמאפשרת לחתוך את אורך הווקטור בלי לאבד הרבה מהדיוק. זה אומר שאפשר לאחסן מסדי נתונים וקטוריים עצומים בשבריר מנפח הזיכרון הרגיל, בלי לעבור שלב דחיסה נפרד אחרי ההרצה.

מתאים ל

  • חיפוש סמנטי במסדי נתונים

    וקטורים בינאריים ו־int8 חוסכים נפח אחסון יקר במסד הנתונים, והמודל עובד בלי צורך להנדס תחיליות לטקסט.

  • שליפת שאילתות מהירה ב־CPU

    גודל של חצי מיליארד פרמטרים מאפשר לחלץ וקטורים במהירות על גבי שרתים זולים ללא צורך במאיץ גרפי.

  • אינדוקס מסמכים רב־לשוניים

    הארכיטקטורה תומכת בריבוי שפות ומתאימה לאינדוקס מאגרים מעורבים באנגלית ובשפות נוספות.

איפה זה נופל

הווקטורים בפורמט int8 יוצאים ללא נרמול. אם תנסו לחשב מרחקים באמצעות מכפלה פנימית רגילה או מרחק אוקלידי בלי לוודא שאתם משתמשים בדמיון קוסינוס, תקבלו תוצאות חיפוש שגויות לחלוטין. מעבר לזה, TEI תומך כרגע רק בהחזרת וקטורים בכימות int8 עבור המודל הזה. חלון של 32K טוקנים הוא אולי מרשים, אבל ניסיון לעבד מסמכים באורך מלא במכה אחת תחת עומס בקשות יביא לקריסת זיכרון מהירה, במיוחד אם לא מגבילים את גודל האצווה והטוקנים בריצה.

אותה משפחה

pplx-embed יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מחשבים דמיון בין הווקטורים שהמודל מחזיר?

חובה להשתמש בחישוב דמיון קוסינוס ולא במכפלה סקלרית פשוטה. המודל מייצר וקטורי int8 שאינם מנורמלים מראש, וחישוב שאינו קוסינוס יחזיר תוצאות לא נכונות.

למה לא להשתמש במודל שמחייב הנחיות כמו 'query:' ו־'passage:'?

המודל הזה נבנה מראש כדי לחסוך את הסיבוך הזה בצד הקוד. שינוי קטן בניסוח ההנחיה עלול לשבש את מרחב הווקטורים ולפגוע באיכות השליפה, וכאן פשוט מעבירים את הטקסט ישירות.

מתי כדאי לבחור בגרסת context של המודל במקום בזו?

גרסת pplx-embed-v1 מיועדת לטקסטים עצמאיים ולשאילתות. אם אתם בונים מערכת RAG ומפרקים מסמכים ארוכים למקטעים שתלויים בהקשר שמסביבם, גרסת ה־context תתאים יותר למשימה הזו.

איך מריצים

קל מאוד להריץ אותו מקומית בפייתון דרך sentence-transformers עם פרמטר trust_remote_code, או בסביבת פרודקשן באמצעות קונטיינר של Text Embeddings Inference מגרסה 1.9.2 ומעלה. עם 596 מיליון פרמטרים ומשקל קבצים כולל של 5.5 גיגה, אפשר לדחוף אותו לכרטיס מסך בסיסי לחלוטין או אפילו להרים אותו על גבי מעבד רגיל באמצעות Candle או ONNX Runtime בלי בעיה.

אם יש לכם כרטיס סביר, אין שום סיבה לשלם על API חיצוני כשמדובר בגודל כזה. מצד שני, אם אתם לא רוצים לנהל שרתים בכלל או זקוקים לזמינות גלובלית מיידית, פרפלקסיטי מציעים נקודת קצה ייעודית שפשוט מעבירים לה קריאת cURL ומקבלים וקטורים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("perplexity-ai/pplx-embed-v1-0.6b")
v = m.encode(["שלום עולם"])

הרישיון

רישיון MIT מלא ומתירני לחלוטין. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו כראות עיניכם. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗