GPT
G

gemma-4-E2B-it-litert-lm

קוד פתוח

litert-communityapache-2.02026-03-25

  • litert-lm

גרסה מותאמת של גוגל להרצה מקומית על טלפונים ומחשבים ללא חיבור רשת. המשקל נמוך במיוחד בזכות קוונטיזציה מעורבת, והיא מגיעה מוכנה ישירות לתשתית LiteRT.

  • 25.4 GBמשקל הקבצים
  • 1,082,611הורדות בחודש
  • 421לייקים

מה זה

החבילה הזו מביאה את Gemma 4 בגרסת הדרכה עם דגש על שימוש בקצה, כמו אנדרואיד, אפל, דפדפן ומכשירי IoT. המודל מבוסס על הארכיטקטורה של ג'מיני ומסופק בפורמט litertlm, שמיועד לעבוד ישירות מול המנוע של LiteRT-LM. המשמעות היא ניהול זיכרון מובנה ל־KV cache, הפעלת פונקציות וקריאה מותאמת לחומרה מקומית.

הייחוד כאן הוא שיטת הדחיסה שמשלבת משקלים של 2, 4 ו־8 ביט. עבור טקסט בלבד, טביעת הרגל של המשקלים בזיכרון יורדת לכ־0.8 גיגה בייט, בעוד פרמטרי ה־embeddings נטענים דרך memory mapping ותופסים עוד כ־1.12 גיגה בייט. מודלי הראייה והשמע נטענים רק לפי דרישה, מה שמונע תפיסת זיכרון מיותרת במכשיר כשהם אינם בשימוש.

מתאים ל

  • עוזר מקומי באפליקציות

    פועל ישירות בתוך אפליקציית מובייל ללא אינטרנט, תוך ניצול צריכת זיכרון מינימלית שמגיעה עד 676 מגה בייט ב־GPU.

  • סיכום ושכתוב במחשב נייד

    מייצר טקסט במהירות גבוהה בזכות פענוח ספקולטיבי, עם קצב מעל 80 טוקנים לשנייה במאיצים גרפיים נתמכים.

  • בינה מלאכותית בדפדפן

    נטען ישירות לעבודה מול WebGPU ללא צורך בהתקנת דרייברים מקומית, באמצעות קובץ ייעודי ומותאם לרשת.

איפה זה נופל

ההרצה על מעבדים חלשים או מחשבי לוח איטית מאוד, כפי שרואים בזמן של שמונה עד תשע שניות לטוקן ראשון ב־Raspberry Pi ו־Jetson Orin Nano על גבי מעבד. גרסת הרשת מוגבלת כרגע לטקסט בלבד, ללא יכולות מולטימדיה. בנוסף, מסלול ההרצה ברשת דרך MediaPipe מוגדר רשמית במצב תחזוקה בלבד, כך שלא כדאי לבנות עליו פרויקטים חדשים. קחו בחשבון שפענוח ספקולטיבי מאיץ משימות שונות בקצבים שונים, ובמשימות קוד או כתיבה חופשית הוא מספק שיפור צנוע יחסית לעומת סיכום טקסט.

שאלות
נפוצות

האם כדאי לשלב אותו באפליקציית אנדרואיד קיימת דרך הקובץ הזה?

במכשירי אנדרואיד תואמים, ההמלצה הרשמית בכרטיס היא להשתמש ב־Android AI Core וב־Gemini Nano במקום לנהל את המודל עצמאית. שימוש ישיר בקובץ מתאים כשרוצים שליטה מלאה על גרסת המודל, או כשמטרגטים מכשירים ומערכות הפעלה נוספות כמו iOS ודסקטופ.

איך עובד הפורמט של הקבצים לעומת משקלים רגילים?

החבילה מסופקת בסיומת litertlm ומותאמת מראש למנוע LiteRT של גוגל, במקום קובצי Safetensors או GGUF רגילים. זה חוסך את הצורך להגדיר שכבות האצה לבד, ומפעיל מראש שילוב של קוונטיזציה של 2, 4 ו־8 ביט לפי סוג המשקלים.

איך מריצים

כדי להריץ אותו משתמשים בספריית LiteRT-LM, שמפעילה את המעבד דרך XNNPack או את המאיץ הגרפי דרך ML Drift. הקבצים הבודדים שוקלים בדרך כלל בין 2 ל־3 גיגה בייט, וצריכת הזיכרון בפועל נעה בין כ־600 מגה בייט עד לכ־3.7 גיגה בייט, תלוי במערכת ההפעלה ובמאיץ. על מחשב חזק או טלפון מודרני תקבלו עשרות טוקנים לשנייה, כאשר ב־GPU של מחשב שולחני הקצב עובר 140 טוקנים לשנייה.

מכשירים חלשים יותר, כמו Raspberry Pi 5, מגרדים 7.6 טוקנים לשנייה עם זמן לתגובה ראשונה של כמעט שמונה שניות. אם יש לכם צורך בתגובה מהירה לחומרה חלשה כזו, או חלון הקשר ענק מעבר למגבלות הזיכרון, פנייה לשרת מרוחק עדיפה על הרצה עצמית.

pip install -U huggingface_hub
hf download litert-community/gemma-4-E2B-it-litert-lm

הרישיון

המודל מופץ תחת רישיון apache-2.0. מדובר ברישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה במוצרים סגורים, ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ועותק הרישיון בכל הפצה של המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗