GPT
G

gemma-4-E4B-it-litert-lm

קוד פתוח

litert-communityapache-2.02026-03-26

  • litert-lm

גרסה מכווצת של גוגל שמיועדת לרוץ ישירות על טלפונים ומחשבים ניידים ללא חיבור רשת. פתרון ממוקד למי שחייב פרטיות מוחלטת וביצועי קצה מהירים.

  • 11.7 GBמשקל הקבצים
  • 320,861הורדות בחודש
  • 202לייקים

מה זה

מדובר בהתאמה של Gemma 4 שפותחה סביב תשתית LiteRT-LM כדי לעבוד על מכשירי קצה. הקובץ המרכזי שוקל 3.66 גיגה בייט ומחזיק מפענח טקסט של 2.24 גיגה בייט לצד משקלי שיבוץ של 0.67 גיגה בייט. המערכת שומרת את המשקלים העיקריים בזיכרון ומבצעת מיפוי זיכרון לשיבוצים, מה שחוסך מקום בפועל בפלטפורמות נתמכות. רכיבי הראייה והשמע לא תופסים משאבים קבועים אלא נטענים רק ברגע שיש בהם צורך.

היתרון המרכזי כאן הוא היכולת לבצע קריאות פונקציה ולנהל הקשר של עד 32 אלף טוקנים בלי לגעת בשרת מרוחק. לפי המדידות הרשמיות, כרטיס RTX 4090 מגיע לקצב של 91.2 טוקנים לשנייה בעיבוד הפלט, בעוד שמחשב נייד חזק מבוסס מעבד M4 Max חוצה את רף 100 הטוקנים לשנייה דרך המעבד הגרפי. במכשירי אנדרואיד כמו S26 Ultra אפשר להגיע למהירות של כמעט 50 טוקנים לשנייה במשימות כתיבת קוד כשמפעילים פענוח ספקולטיבי.

מתאים ל

  • יישומי מובייל מקומיים

    מאפשר לעבד פקודות קול וטקסט על הטלפון בלי לשלוח נתוני משתמש רגישים לרשת.

  • עוזרי קוד בדפדפן

    רץ ישירות בזיכרון המקומי דרך WebGPU ומספק הצעות תחביר ללא עלויות שרת.

  • מערכות דסקטופ לא מקוונות

    מספק יכולת סיכום מסמכים וניסוח טקסטים במחשבים ניידים גם במצב טיסה.

איפה זה נופל

הגרסה המותאמת לרשת מוגבלת כרגע לטקסט בלבד ולא תומכת בקלט מולטימדיה. נוסף לכך, נתיב ההרצה הישן יותר שמבוסס על MediaPipe LLM Inference Engine נמצא במצב תחזוקה בלבד ולא מומלץ לפיתוח חדש. אם המכשיר שלכם נאלץ לרוץ על המעבד המרכזי ללא האצה גרפית, זמני ההמתנה לטוקן הראשון הופכים ארוכים מאוד, במיוחד בסביבות לינוקס חלשות ולוחות פיתוח. פענוח ספקולטיבי משפר ביצועים רק במשימות מסוימות כמו סיכום או קוד, ועבור שימוש בו נדרש קובץ מעודכן שנשמר אחרי מאי 2026.

שאלות
נפוצות

כמה זיכרון עבודה המודל לוקח בפועל בזמן ריצה?

במכשירי אנדרואיד שמריצים אותו על המעבד הגרפי, צריכת הזיכרון עומדת על כ־710 עד 1,069 מגה בייט בלבד בזכות מיפוי הזיכרון של המשקלים. בהרצה על גבי מעבד מרכזי הצריכה מטפסת לאזור ה־3 גיגה בייט, ובמחשבי ווינדוס עם שבבי אינטל היא יכולה לחצות 7 גיגה בייט.

האם כדאי להשתמש בנתיב של MediaPipe לפרויקט חדש?

לא. התיעוד מבהיר שהאינטגרציה דרך MediaPipe נמצאת במצב תחזוקה בלבד. עבור פיתוח חדש מומלץ לעבוד ישירות עם LiteRT-LM או דרך Android AI Core במכשירים תומכים.

איך מריצים

ההרצה מתבצעת באמצעות ספריית LiteRT-LM או דרך יישומי הדגמה ייעודיים לניידים. בסביבת פיתוח שולחנית אפשר להריץ את הכלי דרך ממשק שורת הפקודה, כאשר האצת החומרה מבוססת על XNNPack במעבדים מרכזיים ועל ML Drift במעבדים גרפיים. עבור דפדפנים קיים קובץ מותאם נפרד ששוקל 2.97 גיגה בייט ופועל דרך WebGPU.

מבחינת חומרה, סמארטפון חזק או מחשב עם 8 גיגה בייט זיכרון יריצו את גרסת הטקסט בלי בעיה מיוחדת על גבי המעבד הגרפי. לעומת זאת, אם אתם בונים על לוח כמו Raspberry Pi 5 עם מעבד בלבד, הקצב צונח ל־3.2 טוקנים לשנייה עם זמן תגובה ראשוני של מעל 20 שניות. בתרחיש כזה, או אם אין לקהל שלכם חומרת קצה מודרנית, עדיף להישאר עם API בענן.

pip install -U huggingface_hub
hf download litert-community/gemma-4-E4B-it-litert-lm

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצרים סגורים. הדרישה העיקרית היא שמירה על הודעות זכויות היוצרים ונוסח הרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗