האם יצא לכם לנהל שיחה קולית עם בינה מלאכותית ולהרגיש שזה פשוט לא זה? רוב העוזרות הקוליות כיום מבוססות על תמלול הקול שלכם לטקסט, שליחתו לענן, והמרת התשובה חזרה לקול. התהליך המורכב הזה מייצר השהיה מעצבנת ולא טבעית. כעת, מודל חדש מראה לנו שאפשר לעשות את זה אחרת לגמרי, במהירות מדהימה וישירות מהמחשב האישי שלכם, בלי לשלוח שום מידע החוצה.

איך זה עובד בפועל?
הכירו את PersonaPlex, מודל קולי של חברת אנבידיה בעל 7 מיליארד פרמטרים. בניגוד לעוזרות הרגילות, זהו מודל "דו-כיווני מלא" (Full-Duplex) שחושב ישירות בקול ומעבד במקביל את הדיבור שלכם ואת התשובות שלו. המודל מבוסס על פיתוח קוד פתוח בשם Moshi, המשתמש במקודד קולי מיוחד כדי לדחוס את הדיבור שלכם לקודים מהירים בזמן אמת, מה שמאפשר לנהל איתו שיחה זורמת וטבעית לחלוטין.
הבשורה הגדולה היא שאתם יכולים להריץ את כל הטכנולוגיה הזו אצלכם בבית. הגרסה הרשמית דורשת כרטיס מסך חזק כמו RTX 3090, אך גרסאות קהילתיות מותאמות מאפשרות להריץ את המודל גם על מחשבים ניידים עם כרטיסי מסך צנועים של 8 גיגה-בייט בלבד. ברגע שהורדתם את המודל, השיחה נשארת פרטית לחלוטין על המחשב שלכם, ללא צורך בחיבור לאינטרנט או בתשלום חודשי.

המלכוד של המודל
לצד ההתלהבות, למודל יש מגבלה ייחודית: זיכרון קצר של ארבע דקות בלבד. ברגע שחלון הזמן הזה מתמלא, המודל מתחיל לשכוח את תחילת השיחה. בניסויים שנעשו, דמות של אסטרונאוטית בשם אלכס שכחה לחלוטין את זהותה לאחר שיחה ארוכה על כסף ומכוניות, והכריזה פתאום ששמה הוא קים. משם ההידרדרות מהירה, והמודל עלול להיקלע ללולאות חוזרות של משפטים חסרי משמעות.
חשוב לזכור ש-PersonaPlex אינו מוצר מוגמר כמו העוזרות של ענקיות הטכנולוגיה, והוא לא מסוגל לחפש ברשת או להפעיל כלים חיצוניים. עם זאת, מדובר בהצצה מדהימה ומהירה במיוחד לעתיד של שיחות קוליות טבעיות. כפרויקט קוד פתוח מלא, הוא מהווה בסיס מצוין למפתחים שיבנו עליו את הדור הבא של העוזרים האישיים שלנו.
