GPT
N

NousResearch_Hermes-4-14B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-09-03

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכוילת של Hermes-4 בגודל 14 מיליארד פרמטרים שמתאימה להרצה מקומית. הפתרון פונה למי שמחפש מודל שיחה חזק שרץ על כרטיס מסך ביתי יחיד בלי שרתים מרוחקים.

  • 224 GBמשקל הקבצים
  • 15,950הורדות בחודש
  • 55לייקים

מה זה

המאגר הזה מציג המרות קוונטיזציה של Hermes-4-14B מבית NousResearch, שבוצעו באמצעות llama.cpp עם כיול imatrix. המטרה היא לקחת מודל בינוני ולהקטין את דרישות הזיכרון שלו, כך שיוכל לרוץ במהירות סבירה על מעבדים גרפיים צרכניים או מעבדי CPU.

הייחוד בגרסאות האלו טמון בשימוש בכיול imatrix יחד עם שילוב משקולות ברמת דיוק גבוהה יותר, כמו Q8_0 עבור שכבות הקלט והפלט בחלק מהקבצים. הגישה הזו שומרת על יכולות הניסוח וההבנה של המודל המקורי גם כשדוחסים אותו לגדלים נמוכים, בלי לקרוס באובדן איכות טיפוסי.

מתאים ל

  • עוזר מקומי פרטי

    הרצה מקומית על כרטיס 16GB VRAM לשיחות וניסוחים בלי להוציא מידע לרשת.

  • פיתוח על מחשבי ARM

    ניצול גרסאות ה־Q4_0 עם סידור משקולות אוטומטי להרצה יעילה על מעבדים תואמים.

  • בדיקות קוד סגורות

    מתאים למי שרוצה לבחון יכולות של Hermes-4 על חומרה אישית ללא עלויות תשתית.

איפה זה נופל

הקובץ המקורי לא מפרט את תבנית הפרומפט המדויקת, ולכן צריך ללכת לדף המודל המקורי כדי להבין איך לשלוח לו הוראות בלי לפגוע בתוצאות. קבצים ברמת דחיסה של 2 ביט או 3 ביט מאבדים איכות ניכרת ולא מתאימים לעבודה שדורשת דיוק, למרות שהם עדיין רצים. מעבר לכך, הכרטיס לא כולל מבחני ביצועים ישירים של המודל עצמו אלא רק נתוני מהירות טכניים של הרצה.

שאלות
נפוצות

איזה קובץ כדאי להוריד למחשב עם כרטיס מסך של 12GB?

עדיף ללכת על גרסת Q4_K_M ששוקלת 9.00GB או Q5_K_M ששוקלת 10.51GB. שתיהן משאירות מספיק מקום בזיכרון הכרטיס עבור הקונטקסט ומציעות איזון מצוין בין דיוק למהירות.

איך אפשר לדעת מה הפורמט הנכון לשליחת שאלות למודל?

בדף הזה אין תיעוד של מבנה הפרומפט. צריך להיכנס לקישור של המודל המקורי מבית NousResearch ולקחת משם את התבנית של המערכת והמשתמש.

איך מריצים

ההרצה מתבצעת ישירות דרך llama.cpp או כלים כמו LM Studio. כדי לקבל מהירות טובה כדאי להכניס את כל הקובץ לזיכרון ה־VRAM. קובץ פופולרי כמו Q4_K_M שוקל 9.00GB וירוץ מצוין על כרטיס מסך עם 12GB או 16GB זיכרון, יחד עם מקום שנשאר לקונטקסט. גרסת ה־bf16 המלאה תדרוש כמעט 30GB זיכרון.

אם יש ברשותכם מעבד ARM או חומרה עם AVX, גרסאות כמו Q4_0 או IQ4_NL מבצעות סידור מחדש של המשקולות בזיכרון באופן אוטומטי. מי שמחזיק חומרה חלשה יותר יצטרך לפנות לגרסאות דחוסות מאוד כמו IQ2_M, או פשוט לשלם על קריאות שרת במקום לסבול זמני תגובה אטיים.

ollama run hf.co/bartowski/NousResearch_Hermes-4-14B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המאגר הזה מסומן כלא מדווח. המשמעות פשוטה: אין לכם כרגע אישור ברור לשימוש מסחרי, הפצה מחדש או הטמעה במוצר סגור בלי לבדוק תחילה את תנאי הרישיון המקוריים שפרסמה NousResearch בעמוד המודל הראשי.

הרישיון המלא בעמוד המודל ↗