GPT
N

Nanbeige4.1-3B-Q4_K_M-GGUF

קוד פתוח

Edge-Quantapache-2.02026-02-11

  • transformers
  • gguf
  • llm
  • nanbeige
  • llama-cpp

גרסה מכווצת של מודל קומפקטי לשפות אנגלית וסינית שנועדה לרוץ מקומית בלי לבלוע משאבים. הוא שוקל מעט ומתאים למי שמחפש ביצועים בסיסיים של ג'נרוט טקסט על חומרה חלשה.

  • 2.3 GBמשקל הקבצים
  • 67,103הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל שפה של 3 מיליארד פרמטרים שעבר המרה וכימות לפורמט GGUF דרך llama.cpp. הוא מיועד ליצירת טקסט ותומך בשתי שפות בלבד, אנגלית וסינית. בגלל הגודל הצנוע שלו, הוא מכוון למשימות פשוטות שבהן זמן התגובה והמשקל של הקובץ חשובים יותר מעומק מחשבתי או הבנה של הקשרים מורכבים.

הייחוד כאן הוא בעיקר הנגישות. במקום להתעסק עם מודלים ענקיים שדורשים כרטיסי מסך יקרים, הקובץ הזה יורד מהר ועולה ישירות דרך כלי שורת הפקודה או שרת מקומי. כרטיס המודל לא מציג מבחני ביצועים, מדדי השוואה או פירוט על סט האימון שלו, ומפנה למקור של Nanbeige בלי להרחיב. לכן צריך לקחת בחשבון שאין פה נתונים רשמיים שמוכיחים עליונות על מודלים אחרים באותה קטגוריה, אלא פשוט אריזה נוחה להרצה מקומית קלת משקל.

מתאים ל

  • שרת פנימי למחשב חלש

    שוקל 2.3 גיגה בייט בלבד ומאפשר להריץ שרת מקומי ישירות דרך llama.cpp בלי שרת ייעודי.

  • עיבוד טקסט באנגלית ובסינית

    מתאים לניתוח או השלמת טקסט קצר בשפות שבהן אומן, בלי להוציא מידע מחוץ לרשת המקומית.

  • בדיקות ופיתוח בסביבה מקומית

    עולה מהר בשורת הפקודה לצורך בדיקת פייפליין לפני שמשלבים מודלים כבדים יותר.

איפה זה נופל

המודל מוגדר רשמית רק לאנגלית וסינית, כך שאי אפשר לצפות ממנו לייצר עברית סבירה בלי להיתקל בהזיות או שיבושים קשים. מעבר לכך, כימות לרמה של Q4 חותך מעט מהדיוק של מודל שגם ככה קטן, וחלון ההקשר שהודגם בהרצה עומד על 2048 טוקנים בלבד. הכרטיס דל בפרטים ולא מספק שום אזהרות בטיחות או נתוני ביצועים, כך שחובה לבדוק אותו ביסודיות לפני שחושבים לחבר אותו למערכת פעילה.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

הכרטיס מציין תמיכה באנגלית ובסינית בלבד. סביר מאוד שהוא יתקשה מאוד לייצר עברית תקנית או הגיונית, ולכן למשימות בעברית כדאי לחפש מודל אחר שאומן על השפה.

האם חייבים כרטיס מסך של אנבידיה כדי להפעיל אותו?

אין צורך בחומרה מיוחדת. בגלל הכימות והמשקל הנמוך, הוא ירוץ מצוין על מעבד סטנדרטי בלינוקס או במק דרך llama.cpp בלי לדרוש זיכרון גרפי יקר.

איך מריצים

כדי להריץ אותו צריך רק את llama.cpp מותקן על המחשב, דרך brew או בבנייה ידנית מהמקור עם תמיכה בחיבור רשת. פקודת CLI פשוטה מורידה את הקובץ nanbeige4.1-3b-q4_k_m.gguf ישירות ומריצה פרומפט, או שמפעילים שרת מקומי עם חלון הקשר של 2048 טוקנים.

במשקל של 2.3 גיגה בייט בכימות Q4, כמעט כל מעבד מודרני או מחשב נייד פשוט עם כמה גיגות פנויות של זיכרון יריצו אותו בלי למצמץ, אפילו בלי כרטיס גרפי ייעודי. אם אתם צריכים חלון הקשר ענק, דיוק גבוה במיוחד או מענה למאות משתמשים במקביל, עדיף להשתמש ב־API חיצוני של מודל גדול בהרבה.

ollama run hf.co/Edge-Quant/Nanbeige4.1-3B-Q4_K_M-GGUF:Q4_K_M

הקבצים

3 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗