GPT
P

PDF2Audio

רץ בדפדפן

lamm-mitapache-2.02024-09-22

  • gradio

הכלי הופך מסמכי PDF וטקסט לפרקי פודקאסט, הרצאות או סיכומים קוליים. הוא מיועד למי שרוצה להאזין למאמרים ולחומרי קריאה במקום לקרוא אותם בעיניים.

  • הורדות בחודש
  • 461לייקים

מה זה

אתם מעלים קבצי PDF, קבצי טקסט פשוט או Markdown, ובוחרים תבנית עיבוד כמו פודקאסט עם שני דוברים, הרצאה או סיכום ממוקד. הפלט שמתקבל כולל תסריט כתוב וקובץ אודיו מוגמר להאזנה והורדה, עם אפשרות לערוך את שורות הדיאלוג לפני הרינדור הסופי.

מאחורי הקלעים לא רץ מודל מקומי. הקוד משתמש בחבילת pypdf כדי לחלץ את המלל מהקבצים, שולח אותו למודלי השפה של OpenAI דרך ספריית promptic כדי לייצר תסריט, ואז ממיר את הדיאלוג לקול באמצעות מודלי ה־TTS של אותה חברה. יש דוגמת אודיו מובנית של סיכום מדעי בשם SciAgents, שמציגה תוצאה ערוכה בקולות סינתטיים של שני דוברים.

מתאים ל

  • המרת מאמרי מחקר לפודקאסט

    מעלים קובץ PDF של מאמר אקדמי ומקבלים שיחה קולית בין שני דוברים שמסבירים את עיקרי הממצאים.

  • סיכום מרוכז של מסמכים

    טוענים קובצי טקסט או סיכומי הרצאות כדי להפיק קובץ שמע קצר וממוקד שמסכם את הנקודות החשובות.

  • עריכת תסריט קולי לחומר לימודי

    מייצרים טיוטת שיחה מהטקסט, מתקנים את הניסוח ישירות בממשק, ומרנדרים מחדש לקובץ אודיו נקי.

איפה זה נופל

אם בניתם על שירות חינמי ברשת, זה לא המצב כאן. אתם משלמים ישירות ל־OpenAI על הטוקנים של הטקסט ועל שניות האודיו שנוצרות, מה שיכול להצטבר מהר במסמכים ארוכים. בנוסף, חילוץ הטקסט מבוסס על pypdf פשוט, כך שתרשימים, טבלאות מורכבות וסריקות PDF ללא שכבת טקסט ייכשלו או ייצרו פלט חלקי ועילג.

שאלות
נפוצות

האם השימוש באפליקציה בחינם?

האפליקציה עצמה פתוחה לשימוש, אבל היא דורשת מפתח API פרטי של OpenAI. כל ריצה מחייבת את החשבון שלכם בעלויות יצירת טקסט והמרת שמע מול OpenAI.

מה קורה עם הקבצים שאני מעלה?

הטקסט שנשלף מהמסמכים נשלח ישירות לשרתי OpenAI לצורך יצירת הדיאלוג והקראת האודיו. קבצים זמניים נשמרים מקומית בתיקיית הריצה של השרת לצורך יצירת הנגן.

האם אפשר להריץ את הכלי מקומית?

כן. הקוד פתוח לחלוטין ברישיון אפאצ'י, וקיים גם מחברת Colab ייעודית שהמפתחים שיתפו. אפשר למשוך את הריפו מגיטהאב ולהרים את ממשק ה־Gradio במחשב שלכם.

האם הקולות נשמעים טבעיים?

איכות השמע נקבעת כולה לפי מודל ה־TTS של OpenAI שתבחרו בהגדרות. התוצאה כוללת אינטונציה טובה של קולות סינתטיים, במיוחד בהגדרת שיחה בין שני קולות שונים.

איך משתמשים

גוררים את הקבצים לחלון, בוחרים תבנית וקולות לדוברים, ומזינים מפתח API אישי של OpenAI. בלי המפתח הזה אי אפשר להתחיל, והממשק יזרוק שגיאה מיד כשתלחצו על Generate Audio. המערכת רצה על חומרת מעבד בסיסית, אבל היות שכל העיבוד הכבד נעשה בשרתים של OpenAI, מהירות התגובה תלויה בעיקר בזמן יצירת הטקסט והמרת הקול ב־API החיצוני.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי, שינוי הקוד והפצה מסחרית. המידע שתעלו והתסריטים שייווצרו נשלחים לעיבוד בשרתי OpenAI, כך שהפרטיות והזכויות עליהם כפופות ישירות לתנאי השימוש ומדיניות שמירת הנתונים של OpenAI.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗