GPT
P

POCKET-35B-GGUF

קוד פתוח

FINAL-Benchapache-2.02026-07-22

  • llama.cpp
  • gguf
  • conversational
  • on-device
  • mobile

גרסת קוונטיזציה של מודל 35B שמיועדת לרוץ על מעבד רגיל בלי מאיץ גרפי. הוא מציע מהירות הפקה גבוהה יחסית לגודלו בזכות ארכיטקטורת מומחים דלילה שנטענת בתוכנות מוכרות.

  • 55.1 GBמשקל הקבצים
  • 748,899הורדות בחודש
  • 72לייקים

מה זה

המודל מתבסס על Darwin-36B-Opus שמקורו בארכיטקטורת תערובת מומחים של Qwen3.5 עם 256 מומחים שמתוכם 8 פעילים בכל שלב. ההתבססות על MoE מאפשרת לו לטעון מודל גדול של 35 מיליארד פרמטרים אך לחשב חלק קטן מהם בכל טוקן, מה שמספק קצב הפקה מהיר על חומרה מוגבלת בלי צורך בפיצול מיוחד של הקוד.

בבדיקות המפתחים על מעבד שרת Xeon עם 16 נימים, גרסת IQ1_M סיפקה 27 טוקנים לשנייה, ועל מחשב נייד M3 Pro עם 8 נימים הגיעה ל־13.8 טוקנים לשנייה. עם זאת, בבדיקת ההיגיון GPQA-Diamond, מודל המקור הלא מכווץ עומד על 73.2 אחוזים, בעוד גרסת Q4 יורדת ל־68.7 אחוזים וגרסת Q2 נופלת ל־60.1 אחוזים, כך שיש פגיעה ביכולות החשיבה תמורת החיסכון בזיכרון.

מתאים ל

  • עוזר מקומי במחשב אישי

    הרצה מקומית על מחשבי מיני או מחשבים ללא כרטיס מסך ייעודי, תוך ניצול 16 עד 32 גיגה זיכרון עבודה.

  • יישומי צ'אט במקבוק

    עבודה מקומית ישירות מול המעבד בגרסת Q2_K בקצב של כ־19.5 טוקנים לשנייה בלי לחרוג מתקציב הזיכרון.

  • עיבוד טקסט בארגונים סגורים

    פתרון שמבצע מטלות ניסוח ושיחה על שרתים פנימיים מבוססי מעבד רגיל, ללא צורך בהעברת מידע לשירותי ענן.

איפה זה נופל

הירידה בביצועים בין הקוונטים קיצונית במיוחד בגרסאות הנמוכות, כאשר גרסת IQ1_M פוגעת באיכות פי 2.8 בשפות מסוימות כמו קוריאנית לעומת אנגלית. מעבר לכך, המפתחים מודים שביצועי ריצה על מכשירי iPhone או שבבי Strix Halo טרם נמדדו על ידם. אין בכרטיס המודל שום נתונים או בדיקות לגבי איכות הפלט בעברית, ולכן לא מומלץ להסתמך עליו למשימות בשפה זו בלי לבדוק אותו מראש.

אותה משפחה

POCKET יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל דורש גרסה מותאמת של llama.cpp כדי לעלות?

לא. המודל רץ ישירות על הגרסה הרשמית של הכלי ללא צורך בהתקנת הרחבות או גרסאות קוד נפרדות.

איזו גרסה מתאימה ביותר לשימוש יומיומי מאוזן?

גרסת Q2_K ששוקלת 13 גיגה־בייט מוגדרת כמשתלמת ביותר, ורצה היטב במחשבים עם 16 עד 24 גיגה זיכרון עבודה.

כמה נימים מומלץ להגדיר בפקודת ההרצה במעבד?

יש להגדיר את מספר הליבות הפיזיות בלבד עד לתקרה של כ־32, שכן שימוש בכל הנימים הלוגיים מוביל להאטה.

איך מריצים

כל מה שצריך זה גרסה רגילה ועדכנית של llama.cpp, בלי פורק מיוחד או תמיכה ב־CUDA. כדי להריץ, מפעילים את הפקודה llama-cli ומציינים את מספר הליבות הפיזיות של המעבד בדגל t, ללא שימוש בכל נימי המערכת כדי למנוע האטה חריפה. גרסת Q2_K שוקלת 13 גיגה־בייט ומיועדת למחשבים עם 16 עד 24 גיגה זיכרון עבודה, גרסת Q3_K_M דורשת 24 גיגה, ואילו גרסת Q4_K_M דורשת לפחות 32 גיגה זיכרון עבודה במחשב.

אם אתם צריכים לעבד פרומפטים ארוכים מאוד במהירות שיא, עיבוד הקלט במעבדים גרפיים חזקים כמו H100 הציג כאן 753 טוקנים לשנייה לעומת מתחרים דחוסים, כך שבמקרים של עומסי קריאה כבדים שימוש ב־API ייעודי עשוי להיות מהיר בהרבה מהרצה מקומית על מעבד.

ollama run hf.co/FINAL-Bench/POCKET-35B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון Apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, הפצה והטמעה מלאה במוצרים שלכם ללא תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗