GPT
P

pplx-embed-v1-4b

קוד פתוח

perplexity-aimit2026-01-20

  • sentence-transformers
  • onnx
  • safetensors
  • bidirectional_pplx_qwen3
  • feature-extraction

מודל וקטורי בגודל 4 מיליארד פרמטרים שמיועד לאחזור טקסט בקנה מידה רחב. הוא בולט בזכות חלון ענק של 32K טוקנים וללא צורך בהדבקת תחיליות והוראות מיוחדות לכל שאילתה.

  • 4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 30.0 GBמשקל הקבצים
  • 12,077הורדות בחודש

מה זה

הוא מבוסס על ארכיטקטורת Qwen3 שעברה אימון המשך בשיטת דיפיוז'ן, ומיועד להפקת וקטורים עבור מסמכים ושאילתות חיפוש. בשונה מרוב המודלים המודרניים שמחייבים אתכם לנהל תחיליות והוראות כדי להגיע לביצועים סבירים, כאן מעבירים את הטקסט ישירות כפי שהוא. זה חוסך תחזוקה שבירה של פייפליינים ומונע שינויים במרחב הוקטורי.

המודל מייצר וקטורים ברוחב 2560 ממדים עם תמיכה מובנית בכימות ל־INT8 או בינארי וב־MRL, מה שמאפשר לצמצם את נפח האחסון בבסיס הנתונים בלי לאבד לחלוטין את הדיוק. הוא נועד למשימות חיפוש סמנטי עצמאיות, בעוד שעבור פסקאות בתוך מערכות RAG הדורשות הקשר רחב פותחה גרסה מקבילה נפרדת.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 32,768 טוקנים מאפשר לאנדקס מאמרים ודוחות שלמים בלי לחתוך אותם לחלקים קטנים.

  • אינדוקס ישיר ללא הוראות

    מתאים למערכות שרוצות לקודד שאילתות ומסמכים באותו אופן בדיוק בלי לנהל פרומפטים ותחיליות.

  • אחסון וקטורי מכומת וחסכוני

    תמיכה מובנית בכימות INT8 ובינארי מקטינה את נפח בסיס הנתונים הוקטורי בעבודה בקנה מידה גדול.

איפה זה נופל

הווקטורים נפלטים כברירת מחדל בכימות INT8 כשהם אינם מנורמלים, מה שמחייב אתכם לחשב דמיון קוסינוס בלבד ולא מכפלה סקלרית רגילה, אחרת תקבלו תוצאות שגויות. בנוסף, מודל של 4 מיליארד פרמטרים איטי משמעותית ממודלים קטנים של 0.6 מיליארד, ומחיר החישוב לכל שאילתה גבוה בהרבה.

אותה משפחה

pplx-embed יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מחשבים דמיון בין וקטורים שנוצרו במודל?

הווקטורים מגיעים מכומתים ל־INT8 וללא נירמול. חישוב המרחק חייב להתבצע בעזרת cosine similarity ולא dot product, כדי לא לקבל דירוג שגוי של תוצאות.

מה ההבדל בינו לבין גרסת ה־context?

הדגם הזה מיועד לטקסטים עצמאיים כמו שאילתות חיפוש או מסמכים רגילים. אם אתם בונים מערכת RAG ומאנדקסים מקטעים מתוך מסמך גדול שזקוקים להקשר מסביב, הגרסה המתאימה היא pplx-embed-context.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־30 גיגה בייט, כך שמדובר במודל כבד שמחייב חומרה חזקה. אפשר להריץ אותו מקומית עם ספריית sentence-transformers או דרך קונטיינר ייעודי של Text Embeddings Inference בגרסה 1.9.2 ומעלה עם מעבד או כרטיס מסך, אך צריך לשים לב לנפח הזיכרון כדי לא לקבל שגיאות חריגה בזמן החימום.

אם אין לכם שרת עם מאיץ גרפי ייעודי וזמינות גבוהה, עדיף לגשת ישירות ל־API של Perplexity ולחסוך את עלויות התשתית. ההרצה המקומית משתלמת רק אם יש לכם צרכי פרטיות מחמירים או תעבורת חיפוש עצומה שמצדיקה החזקת שרת 24/7.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("perplexity-ai/pplx-embed-v1-4b")
v = m.encode(["שלום עולם"])

הרישיון

הקוד והמשקולות משוחררים תחת רישיון MIT. זהו רישיון מתירני לחלוטין שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים בלי תשלום תמלוגים, כשהדרישה היחידה היא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗