GPT
A

agentica-org_DeepScaleR-1.5B-Preview-GGUF

קוד פתוח

bartowskimit2025-02-11

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • imatrix

גרסת GGUF מכווצת של מודל קומפקטי בן 1.5 מיליארד פרמטרים שמתמקד ביצירת טקסט. המטרה כאן היא להריץ מודל מקומית על לפטופ פשוט או חומרה חלשה בלי לגעת בענן.

  • 33.1 GBמשקל הקבצים
  • 4,731הורדות בחודש
  • 41לייקים

מה זה

המודל הזה הוא המרה של DeepScaleR-1.5B-Preview לפורמט GGUF, כשהמפתח bartowski ייצר אותו באמצעות כלי llama.cpp עם כיול imatrix. מדובר במודל שפונה בעיקר למשימות טקסט באנגלית, ובנוי להציע חלופה קלת משקל למודלי ענק. הוא לא מתיימר להחליף מודלים כבדים, אבל בגודל של מיליארד וחצי פרמטרים הוא נותן נקודת זינוק מהירה לבדיקות פנימיות.

בכרטיס לא מופיעים מבחני ביצועים ישירים של המודל עצמו אלא בדיקות רקע על מודל אחר של שלושה מיליארד פרמטרים, שמראות שרמות קוונטיזציה מסוימות מקצרות משמעותית זמני עיבוד פרומפטים על גבי מעבדים. ההבדל המרכזי כאן לעומת משקלים מקוריים הוא ביכולת להוריד קובץ בודד שמתחיל מ־750 מגה־בייט ולהריץ אותו ישירות בזיכרון בלי להזדקק למערך שרתים.

מתאים ל

  • פיתוח ובדיקות על לפטופ

    הוא דורש מעט מאוד זיכרון, קובץ Q4_K_M שוקל 1.12 גיגה־בייט וירוץ בקלות על כל מחשב פיתוח בסיסי.

  • עיבוד טקסט באנגלית ב־Edge

    מתאים לשילוב במכשירים ללא חיבור רשת או סביבות מבודדות שדורשות מענה מקומי מהיר ופשוט באנגלית.

  • אוטומציה פנימית ב־CPU

    גרסאות ה־Q4_0 מציעות שיפורי מהירות במעבדי ARM ו־AVX, כך שאפשר להריץ אותו על שרתים פשוטים ללא מאיצים גרפיים.

איפה זה נופל

השפה הנתמכת היא אנגלית בלבד, כך שלא הייתי בונה עליו לשום שימוש בעברית. בנוסף, מדובר בגרסת Preview על בסיס מודל קטן מאוד של 1.5 מיליארד פרמטרים, מה שאומר שהוא יתקשה עם לוגיקה מורכבת, מעקב אחרי הוראות מרובות שלבים או דיוק בעובדות. הכרטיס גם מציין במפורש שרמות כיווץ אגרסיביות כמו Q3_K_S או משפחת Q2 פוגעות באופן מורגש באיכות הפלט, וקוונטים מסוג IQ אינם נתמכים כלל ב־Vulkan.

שאלות
נפוצות

האם המודל יפעל בצורה טובה בעברית?

החומר מגדיר את המודל כדובר אנגלית בלבד. מודלים בגודל 1.5 מיליארד פרמטרים כמעט לא מחזיקים יכולות בשפות שלא הוגדרו באימון, ולכן לא מומלץ להסתמך עליו לפלט בעברית.

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

לרוב המשתמשים ההמלצה של היוצר היא Q4_K_M ששוקל 1.12 גיגה־בייט ומספק איזון מעולה בין גודל לאיכות. אם יש לכם מספיק זיכרון בכרטיס המסך ואתם רוצים איכות גבוהה יותר, קחו את Q6_K_L ששוקל 1.58 גיגה־בייט.

איך מריצים

בשביל להריץ אותו אפשר להשתמש בתוכנות כמו LM Studio או ישירות עם llama.cpp. כל הגרסאות נעות בין 0.75 גיגה־בייט לקוונטים הכי מכווצים כמו Q2_K ועד 7.11 גיגה־בייט למשקל המלא. גרסת ברירת המחדל המומלצת היא Q4_K_M ששוקלת 1.12 גיגה־בייט בלבד, מה שאומר שכל כרטיס מסך בסיסי עם 2 או 3 גיגה זיכרון יחזיק אותה במלואה.

אם יש לכם מעבדי ARM או מעבדים עם AVX2, גרסת Q4_0 תבצע פריסה דינמית של המשקלים בזיכרון לשיפור מהירות הקריאה. אם אתם צריכים רק בדיקות אד־הוק או שאין לכם צורך בפרטיות מקומית מוחלטת, אין סיבה להתעסק עם קבצים והגדרות מעבד כשאפשר פשוט לפנות ל־API מסחרי.

ollama run hf.co/bartowski/agentica-org_DeepScaleR-1.5B-Preview-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

27 קבצים במאגר, 33.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא MIT, מה שאומר חופש מלא לשימוש מסחרי ואישי. אתם יכולים לשלב את הקבצים במוצר שלכם, לשנות אותם ולהפיץ אותם הלאה, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית וכתב הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗