GPT
D

litert-community/DeepSeek-R1-Distill-Qwen-1.5B

קוד פתוח

litert-communitymit2025-02-14

  • litert-lm
  • tflite
  • chat
  • text-generation

גרסה מותאמת של מודל ההסקה הקטן של דיפסיק, ארוזה מראש לריצה מקומית על טלפונים ומכשירי קצה. הפתרון מיועד למי שרוצה יכולות חשיבה ישירות על אנדרואיד בלי לפנות לשרת חיצוני.

  • 31.9 GBמשקל הקבצים
  • 61,605הורדות בחודש
  • 54לייקים

מה זה

מדובר בהמרה של הדגם המזוקק מבית דיפסיק בנפח מיליארד וחצי פרמטרים, המבוסס על קוון, ישירות לתשתיות של גוגל למובייל. המפרסמים ארזו אותו בפורמט שמתאים לריצה דרך סביבת LiteRT וממשק MediaPipe, כך שאין צורך להמיר משקלים ידנית כדי להריץ אותם על מעבדי טלפונים.

המטרה כאן היא להביא מודל היסק שיודע לנמק צעד אחר צעד לתוך חומרה ניידת. לפי הבדיקות שצורפו, על מכשיר סמסונג מדגם אס עשרים וארבע אולטרה, גרסת שמונה ביט מייצרת קצב פענוח של קרוב לעשרים ושבעה טוקנים לשנייה, הן על המעבד הראשי והן על המעבד הגרפי. זה קצב שמיש לחלוטין לקריאה בזמן אמת, אם כי עיבוד הקלט הראשוני על המעבד הגרפי מהיר משמעותית ומגיע ליותר מתשע מאות טוקנים לשנייה.

מתאים ל

  • עוזר מקומי באפליקציית מובייל

    מאפשר פיענוח וסיכום טקסט ישירות על המכשיר בלי תלות בחיבור אינטרנט ובלי לשלם על קריאות שרת.

  • הסקה לוגית בסיסית במכשיר קצה

    פתרון בעיות וניתוח נתונים בסיסי בתוך אפליקציית אנדרואיד תוך ניצול יכולות החשיבה של אר אחד.

  • הדגמות וניסויי קונספט מקומיים

    בדיקה מהירה של יכולות בינה מלאכותית על גבי חומרת טלפון באמצעות אפליקציית ההדגמה המוכנה מראש.

איפה זה נופל

הנתון הבולט לרעה במדידות הוא הזמן עד לקבלת הטוקן הראשון. המתנה של חמש עד שש שניות וחצי עד שהמודל מתחיל לפלוט מילה היא פגיעה מורגשת בחוויית המשתמש, במיוחד ביישומים שמצפים לתגובה מיידית.

בנוסף, מודל של מיליארד וחצי פרמטרים נוטה לפספס בהיסקים מורכבים ביחס לאחיו הגדולים, וצריכת הזיכרון שלו בפועל מגרדת שני גיגה בייט. בטלפונים חלשים יותר ממכשיר הדגל שנבדק, הביצועים עלולים לרדת באופן חד.

שאלות
נפוצות

האם כדאי להריץ את המודל הזה על שרת רגיל או במחשב?

לא מומלץ. האריזה הזו הותאמה ספציפית למנוע LiteRT שמיועד למובייל ורשת, והיוצרים עצמם מציינים שבסביבות כמו קולאב הביצועים יהיו נמוכים משמעותית מאשר על מכשיר קצה מתאים.

כמה זיכרון המודל תופס בפועל בטלפון?

הקובץ המכווץ שוקל כאלף שמונה מאות ושלושים מגה בייט, ובזמן עבודה צריכת הזיכרון המרבית נעה בין שני גיגה בייט לקצת יותר משני גיגה בייט ומאתיים, תלוי אם מריצים על המעבד הגרפי או הראשי.

איך מריצים

המודל פותח במיוחד עבור סביבות אנדרואיד, איי או אס והרשת, ופחות מיועד לשרתים רגילים. הדרך הקלה לבדוק אותו היא להוריד את אפליקציית ההדגמה או קובץ ההתקנה של מדיה פייפ ישירות למכשיר אנדרואיד, או להריץ את מחברת הקולאב המצורפת כדי להכיר את הממשק.

קבצי המשקל בגרסת שמונה ביט שוקלים קצת פחות משני גיגה בייט, כך שכל טלפון מודרני עם זיכרון פנוי יחזיק אותם. אם אתם צריכים תגובה מהירה לחלוטין בלי להעמיס על הסוללה של המשתמש, עדיף להישאר עם קריאות רשת לשירותי ענן.

pip install -U huggingface_hub
hf download litert-community/DeepSeek-R1-Distill-Qwen-1.5B

הרישיון

הרישיון הוא רישיון MIT, מה שאומר שיש לכם חופש מלא להשתמש בקוד ובמשקלים לכל מטרה, כולל מסחרית. מותר להטמיע אותו במוצר סגור, לשנות אותו ולהפיץ אותו, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗