GPT
D

DeepSeek-OCR-GGUF

קוד פתוח

NexaAIרישיון לא דווח2025-11-04

  • gguf
  • deepseek
  • vision-language
  • ocr
  • document-parse

גרסת GGUF לחילוץ טקסט מתמונות ומסמכים מורכבים שמיועדת להרצה מקומית. הפורמט הזה מאפשר להוציא מבנה מרקדאון ותיבות תוחמות ישירות מהטרמינל.

  • 24.5 GBמשקל הקבצים
  • 1,388הורדות בחודש
  • 52לייקים

מה זה

הפרויקט הזה מביא המרה של מודל הראייה והשפה של דיפסיק לחילוץ טקסט, ומכוון לטיפול בקלטים ויזואליים קשים כמו צילומי מסך, קבלות ותמונות שצולמו בטלפון. הוא מחלץ טקסט מודפס או כתב יד ומנסה לשמור על המבנה המקורי של הדף, כולל טבלאות, כותרות ופסקאות מסודרות.

חוץ מטקסט רציף, הוא יודע להחזיר פלט מובנה בפורמט מרקדאון יחד עם תיבות תוחמות שמגדירות איפה כל אלמנט יושב בתמונה. הדגש כאן הוא על קריאה רב לשונית והבנת פריסה מקצה לקצה, כך שאפשר לקבל גם ציוני ביטחון לכל אזור או מילה שחולצו.

מתאים ל

  • המרת מסמכים למרקדאון

    חילוץ טקסט עם שמירה על פסקאות וטבלאות יחד עם תיבות תוחמות.

  • קריאת קבלות וחשבוניות

    שליפת נתונים מובנים מקבצים מצולמים ומסמכים סרוקים ישירות למבנה טקסט.

  • חילוץ טקסט מצילומי מסך

    זיהוי תווים מקלטים ויזואליים באיכות נמוכה או בתאורה בעייתית.

איפה זה נופל

למרות שמדובר בפורמט GGUF שבדרך כלל רץ בכל סביבה, הכרטיס מציין במפורש שרק ה־SDK של נקסה תומך כרגע בקבצים האלה, כך שאי אפשר להשתמש בכלים נפוצים אחרים. מעבר לכך, אין פירוט לגבי איכות הפענוח של עברית או ביצועים על כתב יד בשפות שאינן מרכזיות, וזה משהו שתצטרכו לבדוק בעצמכם על מסמכים אמיתיים לפני הטמעה במערכת עובדת.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה דרך כל כלי שתומך בפורמט GGUF?

לא. הכרטיס מדגיש שכרגע רק NexaSDK תומך בקבצי ה־GGUF של המודל הזה. ניסיון לטעון אותם בספריות אחרות לא יעבוד בלי התאמות של המפתח.

איזה סוגי פלט המודל מחזיר חוץ מטקסט רגיל?

הוא יכול להוציא מסמך מעוצב במרקדאון, קואורדינטות של תיבות תוחמות עבור כל אזור בדף, וציוני ביטחון למילים שזוהו. הבחירה מתבצעת לפי ההנחיה שכותבים לצד התמונה.

איך מריצים

ההרצה המקומית בגרסה הזו מוגבלת כרגע לכלי אחד בלבד, ה־SDK של NexaAI, שדרכו מריצים פקודת הסקה אחת ומזינים את נתיב התמונה ישירות לטרמינל. בסביבת חלונות צריך לוודא שמותקן דרייבר וולקן מעודכן כדי למנוע קריסות בהרצה.

המשקל הכולל של הקבצים מגיע ל־24.5 גיגה בייט, כך שצריך זיכרון פנוי נרחב בכרטיס המסך או ב־RAM כדי לטעון אותו. אם אין לכם מחשב ייעודי עם מספיק זיכרון להחזקת מודל בגודל כזה, פנייה לפתרון מרוחק דרך רשת תהיה פשוטה ומהירה יותר מהתעסקות בהרצה מקומית כבדה.

ollama run hf.co/NexaAI/DeepSeek-OCR-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בתיאור המודל נכתב שהוא משוחרר תחת רישיון אפאצ'י 2.0, למרות שבמטא דאטה של הדף הרישיון מסומן כלא מדווח. תחת אפאצ'י 2.0 מותר להשתמש בו במוצרים מסחריים, לשנות אותו ולהפיץ הלאה, כל עוד שומרים על הקרדיט המקורי ותנאי הרישיון.

הרישיון המלא בעמוד המודל ↗