דלג לתוכן הראשי
צילום: גוגל
צילום: גוגל

גוגל השיקה שדרוג קולי למודל שלה - והצליחה לעורר זעם ברשת

נתנאל שמי
נתנאל שמי

חברת גוגל השיקה את מודלי יצירת הדיבור Gemini 3.8 Flash TTS המאפשרים עיצוב קולות בהתאמה אישית ובימוי דיאלוגים מורכבים • המערכת קוטפת ציוני שיא במבחני איכות עולמיים ומביסה מתחרות • אולם בקרב קהילת המפתחים גובר התסכול עקב דחיית מודל העל Gemini 4 Pro


ענקית הטכנולוגיה גוגל הכריזה בסוף השבוע על השקת צמד מודלי המרת טקסט לדיבור (Text-to-Speech): Gemini 3.8 Flash TTS ו-Gemini 3.8 Flash-Lite TTS. המודלים החדשים הופכים את הפקת הקול באלגוריתם מסט של קולות רובוטיים קבועים לאולפן יצירתי דינמי, המאפשר למפתחים ולחברות לייצר קולות ייחודיים מאפס בהנחיית טקסט חופשית. אולם במקום תשואות גורפות, ההשקה נתקלה בגל ביקורת עוקצני מצד קהילת ה-AI, שאיבדה את הסבלנות לעוד גרסת "פלאש" וממתינה כבר חודשים ארוכים למודל העל האמיתי של החברה.

"עייפנו, שחררו את המפלצת"

הרשתות החברתיות X ו-Reddit הוצפו במבול של ממים ולעג על קצב השחרור של ענקית החיפוש. בעוד שמתחרותיה הגדולות הפציצו לאחרונה את השוק במודלי חזית ענקיים – כמו GPT-6 Astra ו-Sol מבית OpenAI, קלוד 5.5 מבית אנתרופיק וגרוק 4.7 של אילון מאסק – גוגל ממשיכה לפצל את המותג לגרסאות משניות. "כל שאר המעבדות משחררות מודלים, גוגל משחררת תאריכים, ואז עוד מודל פלאש ועוד מודל פלאש", כתב מפתח בפוסט שהפך לוויראלי, לצד קריקטורות של מודל ה-Pro כנעדר תמידי ודרישות נחרצות: "אנחנו עייפים, תשחררו כבר משהו שמכיל את המילה Pro".

התסכול בקרב המפתחים אינו נובע מאיכות המודל הקולי, שמוגדר בפני עצמו כהישג טכנולוגי מרשים, אלא מתחושת תקיעות במרוץ הראש בראש מול ChatGPT ו-Claude במשימות תכנות והסקה מתקדמת. גולשים רבים הביעו אכזבה מכך שרעננו את הפיד שוב ושוב בציפייה לחשיפת ה-Gemini 4 Pro, וגילו במקומו כלי אודיו ממוקד. "זה ללא ספק מודל ה-TTS הטוב ביותר בשוק, אבל זה ממש לא מה שחיכינו לו", סיכם אחד המגיבים בדיון סוער.

מה המודל יודע לעשות בפועל?

חרף הביקורת על התזמון, מבחינה הנדסית גוגל הציגה יכולות מרשימות המציבות סטנדרט חדש בשוק. דגם ה-3.8 Flash TTS מאפשר למשתמשים ליצור יש מאין זהויות קוליות מותאמות אישית בלמעלה מ-100 שפות וניבים, מתוך תיאור מילולי פשוט בלבד. המערכת מסוגלת להפיק קול אנרגטי של תקליטן במבטא אוסטרלי, רובוט מונוטוני צורמני או שאגת דרקון דרמטית, לצד מאגר מוכן של מעל 2,000 קולות הפקה, שכפול קולות מדגימה בת 30 שניות באישור קולי מפורש, וסימון מים דיגיטלי מוטמע בתקן SynthID.

החידוש המהותי ביותר עבור יוצרי פודקאסטים ומשחקים הוא מנגנון "בימוי התסריט שורה-אחר-שורה". המודל אינו רק מקריא טקסט, אלא מאפשר להזין הוראות בימוי פנימיות כמו לחישות בסצנות מתח, שינויי קצב ומבטאים, וביצוע שיחות מרובות-דוברים מתוך תסריט אחיד תוך הפרדה קולית מושלמת. בנוסף, הוטמעה תמיכה במחוות קוליות אנושיות כמו צחוק, אנחות, קטיעות נשימה ומילות אישור טבעיות, המעניקות לשיחה תזמון קומי ואינטראקטיביות חיה.

במבחני האיכות העולמיים, המודל כבש את המקום הראשון במדד Hume AI לעיצוב קולות ואיכות שמע כללית, והוביל בהערכות עיוורות ב-Voice Arena בשפות מרכזיות. הכלים שולבו החל מהיום בסביבת הפיתוח Google AI Studio, בפלטפורמות וידאו כמו Google Vids ו-Gemini Notebook, ובשותפויות מול חברות כמו Figma ו-HeyGen. עם זאת, המבחן האמיתי של מנכ"ל גוגל סונדאר פיצ'אי לא יימדד רק באיכות הדיבוב, אלא ביכולתה של החברה להפסיק למתוח את החבל ולספק לעולם את מודל הדגל העוצמתי הבא שלו כולם מצפים.