GPT
P

POCKET-26B-GGUF

קוד פתוח

FINAL-Benchapache-2.02026-07-24

  • llama.cpp
  • gguf
  • conversational
  • on-device
  • mobile

גרסת GGUF שעברה כיול מיוחד לקוריאנית עבור Gemma 4 של גוגל בתצורת MoE. היא מיועדת להרצה מקומית על מעבד רגיל, בלי להזדקק לכרטיס מסך ייעודי או לגרסאות פיתוח ניסיוניות.

  • 26.0 GBמשקל הקבצים
  • 333,098הורדות בחודש
  • 48לייקים

מה זה

הבסיס כאן הוא מודל תערובת מומחים של גוגל עם עשרים וחמישה מיליארד פרמטרים בסך הכול, אבל רק כארבעה מיליארד מתוכם מופעלים בכל טוקן נתון. היוצרים לקחו את הארכיטקטורה הזו והעבירו אותה כימות מותאם לקוריאנית ששומר על כל מאה עשרים ושמונה המומחים ללא גיזום, מתוך כוונה למנוע את קריסת הביצועים שקורית בדרך כלל בדחיסה אגרסיבית.

בבדיקת GPQA Diamond על מאה תשעים ושמונה שאלות, גרסת Q4 שמרה על ציון זהה למודל המקורי, שישים ושבע נקודה שבע אחוז. אפילו גרסת הדיוק המעורב Q2 ירדה רק בחצי אחוז מהמקור, לעומת מודלים מקבילים שצונחים באזור הזה לכיוון ארבעים וארבעה אחוזים. היתרון המעשי הוא התאימות המיידית, המבנה הזה נתמך כבר בכל תוכנה מוכרת כמו Ollama או LM Studio בלי צורך בהתאמות מיוחדות.

מתאים ל

  • עוזר מקומי על מעבד

    הרצה מקומית על מחשב ביתי בלי כרטיס מסך יקר, בזכות ניצול ארבעה מיליארד פרמטרים פעילים בלבד בכל רגע.

  • עיבוד טקסט בקוריאנית

    כיול המשקלים תוכנן במיוחד לשפה הקוריאנית ומבטיח שימור יכולות גם תחת דחיסה לגרסת שני ביט.

  • שילוב ביישומי צד לקוח

    תאימות מובנית לכלי הרצה נפוצים כמו LM Studio ו־PocketPal מאפשרת הטמעה מהירה בלי הידור ספריות מותאמות.

איפה זה נופל

המודל הזה לא מתאים למכשירים חלשים עם שמונה גיגה בייט זיכרון, שכן הוא דורש לפחות אחד עשר גיגה בייט בקובץ המכווץ ביותר שלו. היוצרים עצמם מציינים כי לא מדדו עדיין ביצועי תפוקה בפועל על גבי מחשבי מק או מכשירי אייפון, כך שקצב הטוקנים לשנייה בסביבות אלו אינו ידוע. בנוסף, כל הכיול והאופטימיזציה נעשו במפורש עבור השפה הקוריאנית, כך שביצועים בעברית אינם מובטחים כלל ויש לבדוק אותם בקפידה.

אותה משפחה

POCKET יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על מחשב נייד בלי כרטיס גרפי?

כן, הוא תוכנן במפורש להרצה על מעבד רגיל. כל עוד יש לכם לפחות שישה עשר גיגה בייט זיכרון עבודה כדי להחזיק את קובץ האחד עשר גיגה בייט לצד מערכת ההפעלה, המודל יעבוד בלי תלות ברכיבי GPU.

האם כדאי לבחור בגרסת Q2 או בגרסת Q4?

בבדיקות המפרסם גרסת Q2 הציגה פגיעה זניחה של חצי אחוז בלבד בדיוק לעומת קובץ המקור. לכן לרוב השימושים היומיומיים גרסת Q2 עדיפה, מכיוון שהיא חוסכת שישה גיגה בייט של זיכרון ומאפשרת פעולה חלקה יותר.

איך מריצים

כדי להריץ את גרסת Q2 ששוקלת אחד עשר גיגה בייט, תצטרכו מחשב או מכשיר נייד עם לפחות שנים עשר גיגה בייט זיכרון. גרסת Q4 דורשת שבעה עשר גיגה בייט ותתאים רק למחשבים עם נפח זיכרון גבוה יותר. ההפעלה נעשית ישירות דרך פקודת llama-cli פשוטה על המעבד, כאשר אפשר להגדיר אפס שכבות להורדה לכרטיס המסך.

היתרון של תצורת המומחים הוא חישוב קל יחסית שמתאים למעבדים ביתיים. עם זאת, אם אתם בונים שירות שדורש מענה מהיר למאות משתמשים במקביל, כדאי לשקול פנייה לשרתי ענן חיצוניים כי מהירות הייצור על מעבד ביתי תישאר מוגבלת מאוד.

ollama run hf.co/FINAL-Bench/POCKET-26B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

5 קבצים במאגר, 26.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים נקודה אפס. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי מלא, שינוי של הקבצים והפצה מחדש בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗