GPT
Q

litert-community/Qwen2.5-1.5B-Instruct

קוד פתוח

litert-communityapache-2.02025-04-30

  • litert-lm
  • tflite
  • chat
  • text-generation

גרסה מומרת של מודל ההוראות הקטן של Qwen, שמיועדת להרצה מקומית על טלפונים דרך LiteRT. היא חוסכת קריאות שרת ומביאה תגובות טקסט מהירות ישירות לתוך אפליקציות במכשיר הקצה.

  • 39.2 GBמשקל הקבצים
  • 67,389הורדות בחודש
  • 51לייקים

מה זה

המאגר הזה מכיל גרסאות של המודל שעברו אופטימיזציה לסביבות מובייל דרך LiteRT, לשעבר TFLite, יחד עם MediaPipe. הוא כולל קבצים בפורמט task עם חתימות prefill מרובות באורכים של 32, 128, 512 ו־1280, שמיועדים לעיבוד מהיר יותר של קלט טקסטואלי.

בדיקות ביצועים שפורסמו על מכשיר Samsung S25 Ultra מראות הבדל עצום בין תצורות. בגרסת הבסיס ללא קוונטיזציה (fp32) על המעבד המרכזי, המודל שוקל 6182 מגה-בייט והזמן לטוקן הראשון מזנק ל־21.25 שניות עם קצב ייצור של 10 טוקנים לשנייה בלבד. לעומת זאת, המעבר ל־dynamic int8 מכווץ את הקובץ ל־1598 מגה-בייט, מוריד את צריכת הזיכרון ומאיץ את העבודה לעד 34.25 טוקנים לשנייה במעבד וקצב prefill של 1667.75 טוקנים לשנייה על ה־GPU.

מתאים ל

  • עוזר מקומי באפליקציות

    מאפשר שיחה ומענה להוראות באנדרואיד וב־iOS ללא חיבור אינטרנט, תוך צריכת פחות מ־2 ג'יגה-בייט RAM ב־int8.

  • עיבוד טקסט קצר במכשיר

    מספק prefill מהיר ב־GPU של מעל 1600 טוקנים לשנייה בחלון של 1280, שמתאים לניתוח טקסטים קצרים בזמן אמת.

  • שילוב ב־MediaPipe

    מתאים לצוותים שכבר משתמשים בתשתיות LiteRT של גוגל ורוצים מודל מוכן להורדה בפורמט task.

איפה זה נופל

חלון ההקשר המרבי שנבדק בכרטיס מגיע ל־4096 טוקנים בלבד, וכאשר עולים מהקשר של 1280 ל־4096, קצב ייצור הטוקנים על ה־GPU יורד מ־30.88 ל־27.30 לשנייה, וזמן התגובה לטוקן הראשון מתארך מ־3.63 ל־4.77 שניות. קצב ה־prefill על ה־GPU נחתך כמעט בחצי, מ־1667.75 ל־933.45 טוקנים לשנייה. גרסת ה־fp32 אינה שמישה הלכה למעשה בטלפונים בגלל משקל של מעל 6 ג'יגה-בייט והמתנה של מעל 20 שניות. בנוסף, המדידות המרשימות נלקחו ממכשיר דגל חזק, ובמכשירים חלשים יותר הביצועים יהיו נמוכים בהרבה.

שאלות
נפוצות

האם כדאי להשתמש בגרסת ה־fp32 באפליקציה מסחרית?

ממש לא. גרסת ה־fp32 שוקלת 6182 מגה-בייט ודורשת יותר מ־21 שניות כדי להחזיר את הטוקן הראשון במעבד. גרסאות ה־dynamic int8 קטנות פי ארבעה, מהירות פי כמה, והן הבחירה ההגיונית היחידה למכשירי קצה.

איך המודל מתמודד עם טקסטים ארוכים במובייל?

הכרטיס מציג תמיכה בעבודה עם הקשר של עד 4096 טוקנים. עם זאת, בהקשר כזה קצב עיבוד הקלט ב־GPU יורד בחדות מ־1667 ל־933 טוקנים לשנייה, וצריכת זיכרון ה־RAM במעבד עולה ליותר מ־2.2 ג'יגה-בייט.

איך מריצים

המודל רץ ישירות על גבי אנדרואיד באמצעות אפליקציית הדגמה Edge Gallery, קובץ apk ייעודי או שימוש ב־MediaPipe LLM Inference API, וקיימת תמיכה גם בהרצה ב־iOS דרך XCode. יש אפשרות לבדוק אותו במחברת Colab, אך המפתחים מבהירים שביצועי הזיכרון והשיהוי ב־Colab עלולים להיות גרועים משמעותית מאשר על חומרה מקומית של מכשיר קצה.

הריצה המקומית על המעבד מנצלת את מאיץ XNNPACK עם ארבעה תהליכונים, אך דורשת כ־2 ג'יגה-בייט של זיכרון RAM פנוי בגרסאות ה־int8. אם אתם בונים שירות ענן מרכזי ולא אפליקציית מובייל עצמאית שחייבת לעבוד ללא רשת, עדיף להשתמש ב־API מרוחק במקום לנהל את המרות המובייל והתקורות של LiteRT בעצמכם.

pip install -U huggingface_hub
hf download litert-community/Qwen2.5-1.5B-Instruct

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית כחלק ממוצר. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית בתוך האפליקציה או חבילת התוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗