GPT
P

Phi-3.5-mini-instruct_Uncensored-GGUF

קוד פתוח

bartowskiapache-2.02024-08-22

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסה מכווצת של מודל קומפקטי שהוסרו ממנו מנגנוני הסינון הרגילים. מתאים למי שרוצה להריץ שפה ישירות על חומרה מקומית צנועה ובלי סירובים מובנים.

  • 47.6 GBמשקל הקבצים
  • 6,730הורדות בחודש
  • 66לייקים

מה זה

מדובר במודל שפה קטן שעבר המרה לפורמט GGUF באמצעות llama.cpp, על בסיס גרסה נטולת צנזורה של Phi 3.5 mini. המטרה כאן היא לתת מענה ישיר לבקשות טקסט בלי מעצורים מלאכותיים ובלי שסתומים מובנים שגורמים למודלים מסחריים לסרב לענות, לצד משקל קל במיוחד שמאפשר להריץ אותו ישירות על מעבד או כרטיס מסך ביתי פשוט.

הקובץ המקורי עבר כיול באמצעות imatrix, תהליך שנועד לצמצם את אובדן הדיוק בזמן הדחיסה. החלק המעניין בחלוקה הזו הוא הניסוי במשקלי ה־embed וה־output, שבחלק מהגרסאות נשמרו ברמת דיוק של Q8_0 כדי לשפר את איכות הפלט הסופי. אין בדף המודל מבחני ביצועים מספריים או השוואות בנצ'מרק, ולכן ההבדלים באיכות נשענים על סוג הכיווץ שתבחרו להוריד.

מתאים ל

  • עוזר מקומי למחשב נייד

    שוקל פחות משלושה גיגה בייט בגרסאות המומלצות ורץ בקלות על מחשבים ללא כרטיס מסך ייעודי.

  • עיבוד טקסט ללא סירובים

    המודל מגיב ישירות לפרומפטים ולא דוחה משימות כתיבה בגלל מנגנוני סינון נוקשים.

  • אינטגרציה מקומית דרך llama.cpp

    פורמט ה־GGUF מאפשר חיבור ישיר לסקריפטים ותוכנות קיימות ללא צורך בשרת חיצוני.

איפה זה נופל

המודל הזה קטן, ומתחת לרמת דיוק של ארבע ביט הפגיעה באיכות מורגשת היטב, כפי שמצוין במפורש על גרסאות כמו Q3_K_S. היעדר הסינון אומר שהוא מייצר טקסט בלי שום בדיקת בטיחות, וזה דורש מכם לבנות שכבת בקרה משלכם לפני שמחברים אותו לממשק ציבורי. בנוסף, אין בכרטיס המודל נתונים על ביצועים בשפות שאינן אנגלית, ויכולות היצירה בעברית לא נבדקו.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עבור רוב המשתמשים, גרסת Q4_K_M בנפח 2.39 גיגה בייט מספקת את האיזון הטוב ביותר בין מהירות לאיכות. אם יש לכם כרטיס מסך מודרני עם מעט זיכרון, שווה לבדוק את IQ4_XS שחוסך מקום ושומר על ביצועים דומים.

האם המודל ירוץ לי על המעבד בלי כרטיס מסך?

כן, קבצי GGUF נבנו לעבודה ישירה על מעבד מרכזי דרך llama.cpp או תוכנות כמו LM Studio. מומלץ לבחור בגרסאות ה־K הרגילות ולא בגרסאות ה־IQ, שנוטות לעבוד לאט יותר בחישוב על מעבד בלבד.

איך מריצים

מורידים רק קובץ בודד מתוך הרשימה, לפי כמות הזיכרון הפנויה אצלכם. כדי לקבל מהירות ריצה גבוהה, מומלץ לקחת קובץ שקטן בגיגה או שניים מנפח ה־VRAM של כרטיס המסך, כמו גרסת Q4_K_M ששוקלת 2.39 גיגה בייט. אפשר להריץ אותו מיידית בתוך LM Studio או ישירות מול llama.cpp בעזרת הפורמט המוגדר עם תגיות המערכת והמשתמש שמופיעות בתיעוד.

מי שמחזיק מעבד גרפי של Nvidia או AMD יכול להשתמש גם בגרסאות ה־IQ הקטנות יותר, כמו IQ3_M בנפח 1.86 גיגה בייט, שמספקות איכות טובה ביחס לגודל. על מעבדים רגילים או סביבות אפל הגרסאות האלה ירוצו לאט יותר, ושם עדיף להישאר עם ה־K הרגיל.

ollama run hf.co/bartowski/Phi-3.5-mini-instruct_Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא apache-2.0. מותר להשתמש במודל לצרכים מסחריים ופרטיים, לשנות אותו, לשלב אותו במוצרים ולהפיץ עותקים שלו. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, והוא מגיע ללא אחריות מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗