GPT
P

phonellm-alpha-1

קוד פתוח

pipecat-aibsd-2-clause2026-08-24

  • transformers
  • safetensors
  • nemotron_h
  • text-generation
  • nemotron

המודל הזה נבנה לסוכני קול טלפוניים שצריכים להפעיל כלים בזמן שיחה בלי לחכות לטוקנים של חשיבה. הוא מספק זמני תגובה של מאות מילישניות בלי לשלם עלויות עתק למודלי ענן סגורים.

  • 32Bפרמטרים
  • 262,144טוקנים בהקשר
  • 58.8 GBמשקל הקבצים
  • 31,439הורדות בחודש

מה זה

מדובר באימון מלא על בסיס Nemotron 3 Nano של אנבידיה בארכיטקטורת Mamba משולבת Transformer ומומחים. מתוך 30 מיליארד פרמטרים רק 3.5 מיליארד פעילים בכל רגע, מה שמקטין את עומס החישוב ומאפשר להחזיק זמני תגובה קצרים במיוחד.

בבנצ'מרק PhoneBench שבודק סוכני שיחה, המודל השיג ציון ממוצע של 72.05 בגרסת המשקלים המקורית, ורשם זמני מענה ראשוני מהירים ב־1,300 מילישניות לעומת GPT 5.6 Terra תוך חיתוך של 94 אחוז בעלויות. המדידות מראות שהוא יודע להפעיל כלים במהלך שיחה מתמשכת בלי להיתקע בחשיבה פנימית ובלי להכריז על פעולות שהוא לא באמת ביצע.

מתאים ל

  • מוקדי שירות לקוחות

    מענה לשיחות נכנסות בענפי פיננסים וקמעונאות עם תגובה קולית מהירה והפעלת כלי בדיקת יתרות והזמנות.

  • סוכני שיחות יוצאות

    ביצוע שיחות עדכון או תיאום תורים באנגלית ללא זמני שתיקה מביכים בין המשפטים של הלקוח.

  • אימות וניתוב שיחות

    זיהוי צרכי המתקשר והעברה מסודרת לנציג אנושי לפי תסריט קבוע וקפדני.

איפה זה נופל

המודל אומן באנגלית בלבד ולא יתאים לשיחות בעברית. בנוסף, חל איסור מוחלט להפעיל בו מנגנוני חשיבה, כי כל האימון מכויל לטמפרטורה אפס ולשליפת כלים ישירה. אם המוצר שלכם דורש פתרון בעיות לוגיות סבוכות או שיחות חופשיות שלא מבוססות על תסריטי שירות והפעלת פונקציות מוגדרות מראש, הוא לא יספק את התוצאה.

שאלות
נפוצות

האם המודל תומך בשיחות טלפון בעברית?

לא. המודל אומן ומוגדר לשפה האנגלית בלבד, וכל נתוני הבדיקה מתבססים על שיחות באנגלית.

אפשר להריץ אותו על מחשב מקומי או שרת רגיל?

המשקלים בגרסה הזו תופסים קרוב ל־60 גיגהבייט ודורשים חומרה ייעודית כמו כרטיסי Blackwell של אנבידיה כדי לשמור על זמני תגובה נמוכים. לרוב המפתחים עדיף להריץ אותו דרך שירות ענן כמו Modal שמציע פריסה מותאמת למודל הזה.

למה צריך לבטל את החשיבה בהגדרות המודל?

בשיחות קוליות כל עיכוב פוגע בחוויה, והמודל עבר אימון ייעודי להפעלת כלים מיידית בטמפרטורה אפס בלי לייצר טוקנים של חשיבה מקדימה שמעכבים את המענה.

איך מריצים

כדי להריץ את המודל המקורי במשקלי bfloat16 שתופסים כמעט 59 גיגהבייט, צריך כרטיס חזק כמו NVIDIA B200 דרך vLLM או SGLang. יש גם גרסה מכוילת NVFP4 לאותה חומרה שמגיעה לציון כמעט זהה של 72.01 עם שמירה על זיכרון הקשר ב־BF16, ומאפשרת להגיע לעשרות שיחות במקביל על מעבד גרפי יחיד.

חובה לקנפג את ההרצה עם טמפרטורה אפס ולבטל את מנגנון החשיבה. למי שאין שרתים עם חומרה ברמה הזו, אפשר לפרוס אותו בענן של Modal בפקודת CLI ישירה שכוללת אופטימיזציה לסוכני שיחה, במקום לתחזק אשכול עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="pipecat-ai/phonellm-alpha-1")
print(pipe("שלום"))

הרישיון

הרישיון הוא BSD 2-Clause שמתיר שימוש מסחרי, שינוי והפצה בלי תמלוגים. בגלל שהמודל מתבסס על Nemotron של אנבידיה, חובה לצרף בכל הפצה של הקבצים או נגזרות שלהם את עותק רישיון המקור של אנבידיה ואת הודעות זכויות היוצרים.

הרישיון המלא בעמוד המודל ↗