September 14, 2026

Namma Multimedia

The gold mine of tomorrow's world

மனிதரைப் போல கேட்டு, இடைமறித்து பேசும் AI — GPT-Live-1 வந்தாச்சு!

OpenAI ஜூலை 8 அன்று அறிமுகப்படுத்திய GPT-Live-1 மற்றும் GPT-Live-1 mini conversational voice models, செயற்கை நுண்ணறிவுடன் நாம் பேசும் முறையையே மாற்றும் புதிய முயற்சியாக அமைந்துள்ளன. ஒருவர் பேசி முடித்த பிறகுதான் மற்றவர் பேச வேண்டும் என்ற பழைய Voice AI கட்டுப்பாட்டைக் கடந்து, பயனர் பேசிக்கொண்டிருக்கும்போதே கேட்பது, உரையாடலின் நடுவே ஏற்படும் இடைமறிப்புகளைப் புரிந்துகொள்வது, தேவையான இடத்தில் பதிலளிப்பது, இயல்பான இடைவெளிகளை உணர்வது, live translation போன்ற செயல்களை மேற்கொள்வது என மனித உரையாடலுக்கு நெருக்கமான அனுபவத்தை உருவாக்குவதே GPT-Live குடும்பத்தின் முக்கிய நோக்கம்.

குரல் அழகாக இருப்பது மட்டும் Voice AI அல்ல!

செயற்கை நுண்ணறிவு குரல் தொழில்நுட்பத்தில் இதுவரை பெரும்பாலான கவனம், AI எவ்வளவு இயல்பான மனிதக் குரலில் பேசுகிறது என்பதிலேயே இருந்தது. ஆனால் உண்மையான மனித உரையாடலை உருவாக்குவதில் குரலின் தரத்தைவிட முக்கியமான சிக்கல் ஒன்று இருக்கிறது — யார் எப்போது பேசுவது?

நண்பருடன் பேசும்போது அவர் ஒரு வாக்கியத்தை முழுமையாக முடிக்கும் வரை நாம் இயந்திரம் போல அமைதியாகக் காத்திருப்பதில்லை. அவர் பேசிக்கொண்டிருக்கும்போதே “ம்…”, “ஆமாம்…”, “சரி…” என்று நமது கவனத்தை வெளிப்படுத்துகிறோம். புரியாத இடத்தில் உடனே கேள்வி கேட்கிறோம். தவறாகப் புரிந்துகொண்டால் நடுவிலேயே திருத்துகிறோம். அவர் சிந்தித்துக் கொண்டிருந்தால் சில விநாடிகள் அமைதியாகக் காத்திருக்கிறோம். இவை அனைத்தும் மனிதர்களுக்கு மிகவும் இயல்பானவை; ஆனால் Voice AI அமைப்புகளுக்கு மிகவும் சிக்கலானவை.

GPT-Live-1 இந்தச் சிக்கலையே நேரடியாகக் கையாள முயல்கிறது. அதனால் இதை இன்னொரு புதிய AI voice என்று மட்டும் பார்ப்பதைவிட, AI எப்படி உரையாட வேண்டும் என்பதற்கான புதிய architecture என்று பார்ப்பதே பொருத்தமானது.

Full-Duplex — GPT-Live-1-ன் முக்கிய ரகசியம்!

GPT-Live-1-ன் அடிப்படையான மாற்றம் அதன் full-duplex conversational architecture. பழைய Voice AI அனுபவத்தை walkie-talkie உரையாடலுடன் ஒப்பிடலாம். முதலில் பயனர் பேசுவார்; அவர் பேசி முடித்ததை system கண்டறியும்; அதன் பிறகு AI அந்தப் பேச்சைப் புரிந்துகொண்டு பதில் உருவாக்கும்; AI பதில் முடிந்ததும் மீண்டும் பயனர் பேசுவார். இது மனித உரையாடலைவிட ஒரு கேள்வி–பதில் நிகழ்ச்சியைப் போன்ற அனுபவத்தையே அதிகமாக உருவாக்கியது.

Full-duplex முறையில் இந்தக் கடுமையான எல்லை குறைகிறது. AI பேசிக்கொண்டிருக்கும்போதும் பயனர் தரப்பிலிருந்து வரும் audio input-ஐ system தொடர்ந்து கவனிக்க முடியும். பயனர் இடைமறித்தால் அதைக் கண்டறிந்து உரையாடலை மாற்றிக்கொள்ளவும், பயனர் இன்னும் பேசிக்கொண்டிருந்தால் காத்திருக்கவும், பொருத்தமான நேரத்தில் சிறிய acknowledgment வழங்கவும் முடியும். இதனால் Voice AI-யின் முக்கியமான கேள்வி “என்ன பதில் சொல்வது?” என்பதிலிருந்து “எப்போது பேசுவது, எப்போது கேட்பது, எப்போது அமைதியாக இருப்பது?” என்பதற்கும் விரிவடைகிறது.

“ம்… ஆமாம்…” — இந்த இரண்டு வார்த்தைகளுக்குப் பின்னால் பெரிய AI தொழில்நுட்பம்!

ஒருவர் நம்மிடம் ஐந்து நிமிடங்கள் ஒரு விஷயத்தைச் சொல்கிறார் என்று வைத்துக்கொள்வோம். நாம் ஐந்து நிமிடங்களும் எந்தச் சத்தமும் இல்லாமல் அமர்ந்திருந்தால், “இவர் கேட்கிறாரா?” என்ற சந்தேகம் அவருக்கு வரும். அதனால்தான் மனிதர்கள் உரையாடலில் சிறிய acknowledgements பயன்படுத்துகிறார்கள். “ம்…”, “ஆமாம்…”, “புரிகிறது…” போன்ற எதிர்வினைகள் தகவலைச் சேர்க்காவிட்டாலும் உரையாடலை உயிர்ப்புடன் வைத்திருக்கின்றன.

GPT-Live போன்ற conversational models-ல் இதுபோன்ற backchannel responses முக்கியமானவை. அதே நேரத்தில் ஒவ்வொரு சிறிய இடைவெளியிலும் AI “சரி!” என்று பேச ஆரம்பித்துவிட்டால் அதுவே தொந்தரவாகிவிடும். எனவே எப்போது சிறிய acknowledgment கொடுக்க வேண்டும், எப்போது பேசாமல் தொடர்ந்து கேட்க வேண்டும் என்பதைத் தீர்மானிப்பதும் Voice AI-யின் intelligence-ன் ஒரு பகுதியாகிறது.

இங்கேதான் GPT-Live அணுகுமுறையின் முக்கியத்துவம் தெரிகிறது. ஒரு நல்ல conversational AI என்பது அதிகமாகப் பேசும் AI அல்ல; சரியான நேரத்தில் பேசும் AI.

“இல்லை… நான் கேட்டது அது இல்லை!” — இனி நடுவிலேயே சொல்லலாம்

AI voice assistants-ஐ பயன்படுத்தியவர்களுக்கு பரிச்சயமான அனுபவம் ஒன்று உண்டு. கேள்வியை AI தவறாகப் புரிந்துகொண்டு நீண்ட பதிலை ஆரம்பித்துவிட்டால், அதை நிறுத்தி “நான் கேட்டது வேறு” என்று சொல்ல முயற்சிப்போம். பழைய turn-based systems-ல் இந்த interruption இயல்பாகக் கையாளப்படாமல் போகலாம்.

GPT-Live-1 போன்ற full-duplex அமைப்பின் முக்கிய பயன்பாடு இதுதான். AI பதில் சொல்லிக்கொண்டிருந்தாலும் பயனர் மீண்டும் பேசத் தொடங்குவதை system கவனிக்க முடியும். அந்தப் புதிய input உரையாடலின் direction-ஐ மாற்றக்கூடும். இதனால் AI-யுடன் பேசுவது முன்பே எழுதப்பட்ட voice menu-வுடன் தொடர்புகொள்வது போல இல்லாமல், மனிதருடன் நடக்கும் உரையாடலைப் போன்றதாக மாறுகிறது.

Customer service போன்ற துறைகளில் இந்த மாற்றம் மிக முக்கியமானதாக இருக்கலாம். “உங்கள் account number சொல்லுங்கள்” என்று AI கேட்கும்போது, வாடிக்கையாளர் “ஒரு நிமிஷம், முதலில் என் பிரச்சினையை முழுவதும் கேளுங்கள்” என்று இடைமறிக்க முடியும். Voice AI அதைப் புரிந்துகொண்டால், customer-support bots பற்றிய அனுபவமே மாறக்கூடும்.

அமைதிக்கும் அர்த்தம் உண்டு — அதை AI புரிந்துகொள்ள வேண்டும்

மனித உரையாடலில் silence என்பது conversation முடிந்துவிட்டது என்பதற்கான அறிகுறி மட்டுமல்ல. ஒருவர் சிந்திக்கலாம்; சரியான வார்த்தையைத் தேடலாம்; ஒரு பெயரை நினைவுபடுத்த முயற்சிக்கலாம். “நேற்று நான் பார்த்த படம்… ஒரு நிமிஷம்… அந்த நடிகர் பெயர்…” என்று பேசும்போது வரும் அமைதி, நாம் பேசி முடித்துவிட்டோம் என்று பொருளல்ல.

பாரம்பரிய Voice AI-களுக்கு இது பெரிய சவால். மிக விரைவாக turn முடிந்ததாக எடுத்துக்கொண்டால் AI நடுவே பேசத் தொடங்கும்; அதிக நேரம் காத்திருந்தால் பதில் மந்தமாகத் தோன்றும். இந்த turn detection பிரச்சினை conversational AI-யின் முக்கியமான ஆய்வு பகுதிகளில் ஒன்றாக இருந்து வருகிறது.

GPT-Live architecture continuous audio interaction-ஐ மையமாகக் கொண்டிருப்பதால், pause, interruption, conversational timing போன்றவற்றை text chatbot logic-க்கு வெளியே தனித்துவமாகக் கையாளும் வாய்ப்பு உருவாகிறது. இது சிறிய technical improvement அல்ல; மனிதர்–AI உரையாடலின் இயல்பை நிர்ணயிக்கும் அடிப்படை அம்சம்.

Live Translation — உங்கள் பாக்கெட்டில் ஒரு மொழிபெயர்ப்பாளர்?

GPT-Live போன்ற full-duplex voice models திறக்கும் மிகப் பெரிய வாய்ப்புகளில் ஒன்று நேரடி மொழிபெயர்ப்பு. தற்போது மொழிபெயர்ப்பு செயலிகளில் ஒருவர் பேசுவதை பதிவு செய்து, அது text அல்லது translated audio ஆக மாறிய பிறகு அடுத்தவர் பதில் சொல்லும் அனுபவம் பொதுவாக உள்ளது. Full-duplex conversational system வளரும்போது, இரண்டு மொழிகளைப் பேசும் மனிதர்களுக்கிடையே AI ஒரு தொடர்ச்சியான interpreter போலச் செயல்பட முடியும்.

உதாரணமாக, தமிழ் மட்டுமே தெரிந்த ஒருவர் ஜப்பானில் ஒரு கடைக்குச் செல்கிறார் என்று வைத்துக்கொள்வோம். அவர் தமிழில் கேட்பதை AI ஜப்பானிய மொழியில் தெரிவித்து, கடைக்காரரின் பதிலை மீண்டும் தமிழில் கூறும் conversational bridge உருவாகலாம். சுற்றுலா, மருத்துவமனை reception, சர்வதேச வணிகம், கல்வி, customer support போன்ற பல துறைகளில் இதன் பயன்பாடு மிகப் பெரியதாக இருக்கலாம்.

ஆனால் இங்கே ஒரு முக்கிய எச்சரிக்கையும் தேவை. AI மொழிபெயர்ப்பு இயல்பாகக் கேட்பது மட்டுமே அதன் துல்லியத்துக்கு உத்தரவாதம் அல்ல. பெயர்கள், வட்டார வழக்குகள், கலாசார நுணுக்கங்கள், தொழில்நுட்பச் சொற்கள், சட்ட அல்லது மருத்துவ உரையாடல்கள் போன்றவற்றில் தவறுகள் ஏற்படலாம். எனவே live translation திறன் வளர்ந்தாலும், அதிக ஆபத்துள்ள சூழல்களில் மனித சரிபார்ப்பு தொடர்ந்து முக்கியமானதாகவே இருக்கும்.

Voice AI எல்லாவற்றையும் தனியாகச் செய்ய வேண்டுமா?

GPT-Live அணுகுமுறையில் கவனிக்க வேண்டிய இன்னொரு பெரிய மாற்றம், உரையாடலை நடத்துவது மற்றும் கடினமான reasoning செய்வது இரண்டும் ஒரே வேலை அல்ல என்ற புரிதல்.

ஒரு நண்பருடன் பேசும்போது அவர் கேட்ட கேள்விக்கு பதில் சொல்ல Google-ல் தேட வேண்டியிருக்கலாம். ஆனால் தேடிக்கொண்டிருக்கும்போது உரையாடல் முழுவதும் உறைந்து போவதில்லை. “ஒரு நிமிஷம், பார்க்கிறேன்…” என்று சொல்லி தொடர்பைத் தொடர முடியும். AI-க்கும் இதே மாதிரியான architecture பயனுள்ளதாகிறது.

Voice model உரையாடலின் timing, speech interaction மற்றும் conversational flow-ஐ கவனித்துக்கொள்ள, பின்னணியில் மற்றொரு frontier model web search, reasoning அல்லது tool use போன்ற கடினமான பணிகளைச் செய்யும் அமைப்பு உருவானால், Voice AI வெறும் speech interface ஆக இருக்காது. அது பல AI திறன்களை ஒருங்கிணைக்கும் front-end conversational layer ஆக மாறும்.

இதன் எதிர்கால வடிவத்தை எளிமையாகச் சொன்னால்: நம்மிடம் பேசுவது ஒரு AI; பின்னால் நமக்காக வேலை செய்வது பல AI systems.

GPT-Live-1 mini ஏன் முக்கியம்?

பெரிய AI model ஒன்றை உருவாக்குவது மட்டும் போதாது. Voice conversation-க்கு response latency மிக முக்கியம். ஒருவர் கேள்வி கேட்ட பிறகு ஒவ்வொரு முறையும் பல விநாடிகள் அமைதி ஏற்பட்டால், model எவ்வளவு புத்திசாலியாக இருந்தாலும் உரையாடல் இயல்பாகத் தெரியாது. அதேபோல் கோடிக்கணக்கான பயனர்கள் தினமும் நீண்ட நேரம் voice conversation பயன்படுத்தும்போது compute cost-மும் முக்கியமாகிறது.

இந்தப் பின்னணியில் GPT-Live-1 உடன் GPT-Live-1 mini இருப்பது முக்கியமானது. Smaller voice models வேகம், செலவு மற்றும் பெரிய அளவிலான deployment ஆகியவற்றில் பயன் தர முடியும். AI துறையின் அடுத்த போட்டி “மிகப்பெரிய model யாரிடம்?” என்பதில் மட்டும் இருக்காது; எப்போதும் பயன்படுத்தக்கூடிய அளவுக்கு வேகமாகவும் மலிவாகவும் intelligence-ஐ வழங்குவது யார்? என்பதிலும் இருக்கும்.

Voice AI-க்கு இது இன்னும் முக்கியம். Text chatbot-ல் பதில் வர இரண்டு விநாடிகள் காத்திருப்பது பெரிய பிரச்சினையாகத் தெரியாமல் இருக்கலாம்; நேரடி உரையாடலில் இரண்டு விநாடி அமைதியே நீண்டதாக உணரப்படும்.

Call Center-களின் எதிர்காலத்தை மாற்றுமா?

GPT-Live போன்ற தொழில்நுட்பங்களின் மிகப்பெரிய வணிகப் பயன்பாடு customer service துறையில் உருவாக வாய்ப்பு உள்ளது. இன்றைய automated phone systems-ல் “தமிழுக்கு ஒன்று அழுத்தவும், ஆங்கிலத்திற்கு இரண்டு அழுத்தவும்” என்ற menu முறையிலிருந்து தொடங்கி, predefined commands-ஐப் புரிந்துகொள்ளும் voice bots வரை வளர்ச்சி ஏற்பட்டுள்ளது. Full-duplex conversational AI அடுத்த கட்டத்தில் வாடிக்கையாளர் தனது பிரச்சினையை இயல்பாகச் சொல்ல அனுமதிக்கலாம்.

ஒருவர் credit card பிரச்சினையை விவரிக்கும்போது AI நடுவே தேவையான clarification மட்டும் கேட்கலாம்; வாடிக்கையாளர் AI-யை இடைமறித்து திருத்தலாம்; பின்னணியில் account tools அல்லது knowledge systems-ஐ அணுகி பதில் பெறலாம்; தேவையான நிலையில் மனித agent-க்கு context உடன் conversation-ஐ மாற்றலாம். இது நடைமுறையில் நம்பகமாகச் செயல்பட்டால் call-center automation-ன் தரமே மாறக்கூடும்.

அதே நேரத்தில் AI voice மனித குரலைப் போன்றதாக மாறும்போது, “நான் மனிதருடன் பேசுகிறேனா, AI-யுடன் பேசுகிறேனா?” என்ற transparency கேள்வியும் முக்கியமாகிறது. குறிப்பாக வங்கி, மருத்துவம், அரசு சேவை போன்ற துறைகளில் AI என்பதை பயனருக்குத் தெளிவாக அறிவிப்பது நம்பிக்கைக்கு அவசியமாக இருக்கும்.

Voice AI-யின் அடுத்த பெரிய சவால் — உணர்ச்சி

ஒருவர் “என் flight cancel ஆயிடுச்சு!” என்று கோபமாகச் சொல்வதும், “என் flight cancel ஆயிடுச்சு…” என்று சோர்வுடன் சொல்வதும் text transcript-ல் ஒரே வாக்கியமாக இருக்கலாம். ஆனால் மனிதருக்கு அவை இரண்டும் முற்றிலும் வேறு செய்திகளாகத் தெரியும். குரலின் வேகம், அழுத்தம், pause, pitch போன்றவை அர்த்தத்தை மாற்றுகின்றன.

இதனால் எதிர்கால Voice AI-யின் போட்டி speech recognition accuracy-ல் மட்டும் இருக்காது. என்ன சொன்னார்? என்பதுடன் எப்படிச் சொன்னார்? என்பதையும் எவ்வளவு சரியாகப் புரிந்துகொள்கிறது என்பது முக்கியமாகும். ஆனால் emotion inference தவறாகவும் இருக்கக்கூடும்; ஒருவரின் குரலை வைத்து அவருடைய மனநிலையை உறுதியாக முடிவு செய்வது ஆபத்தானது. எனவே இந்தத் திறன்களுக்கு தொழில்நுட்ப முன்னேற்றத்துடன் privacy மற்றும் responsible-use விதிகளும் தேவைப்படும்.

Keyboard-க்கு விடை கொடுக்கும் தொடக்கமா?

கணினியுடன் மனிதன் தொடர்புகொண்ட வரலாற்றைப் பார்த்தால் ஒவ்வொரு காலத்திலும் interface மாறியுள்ளது. Command line-ல் கட்டளைகளை எழுதினோம்; mouse மற்றும் graphical interface வந்தது; touchscreen வந்தது; பின்னர் search box மற்றும் chatbot வந்தன. Generative AI காலத்தில் prompt எழுதுவது புதிய interface ஆனது.

ஆனால் மனிதர்களின் இயல்பான interface இன்னும் பழமையான ஒன்றுதான் — பேச்சு.

Voice AI உண்மையில் இயல்பானதாக மாறினால், ஒவ்வொரு வேலைக்கும் keyboard எடுத்துப் prompt எழுத வேண்டிய அவசியம் குறையலாம். காரை ஓட்டும்போது research செய்யலாம்; சமையல் செய்யும்போது recipe-யின் அடுத்த படியை கேட்கலாம்; ஒரு presentation தயாரிக்கும்போது நடந்துகொண்டே ideas விவாதிக்கலாம்; வயதானவர்கள் complicated menus இல்லாமல் சேவைகளை அணுகலாம்; குழந்தைகள் AI tutor-ஐ கேள்விகளால் இடைமறித்து பாடம் கற்கலாம்.

அப்போது AI ஒரு app-ஆக மட்டும் இருக்காது. நம்முடன் எப்போதும் பேசக்கூடிய computing interface ஆக மாறும்.

‘பேசும் இயந்திரம்’ அல்ல; ‘உரையாடும் கூட்டாளி’

GPT-Live-1-ன் முக்கியத்துவத்தை அதன் குரல் எவ்வளவு மனிதரைப் போல இருக்கிறது என்பதைக் கொண்டு மட்டும் மதிப்பிட முடியாது. அதன் உண்மையான சோதனை, மனித உரையாடலின் குழப்பமான இயல்பை எவ்வளவு நன்றாகக் கையாளுகிறது என்பதில்தான் இருக்கிறது. நாம் வாக்கியத்தை பாதியில் நிறுத்துவோம்; திருத்துவோம்; இடைமறிப்போம்; தலைப்பை மாற்றுவோம்; சில நேரங்களில் அமைதியாக இருப்போம். உண்மையான conversational AI இவற்றையெல்லாம் கையாள வேண்டும்.

அதனால்தான் GPT-Live போன்ற full-duplex models ஒரு முக்கியமான மாற்றத்தைக் குறிக்கின்றன. Text AI-யிடம் நாம் சரியான prompt எழுத முயன்றோம். Voice AI-யின் அடுத்த தலைமுறையில், AI தான் நமது இயல்பான உரையாடல் முறைக்கு ஏற்றவாறு தன்னை மாற்றிக்கொள்ள வேண்டும்.

அந்த இலக்கு முழுமையாக எட்டப்பட்டுவிட்டது என்று இப்போதே கூற முடியாது. மொழித் துல்லியம், latency, தவறான interruptions, privacy, voice impersonation, hallucination, translation errors போன்ற பல சவால்கள் தொடர்கின்றன. ஆனால் திசை தெளிவாகிவிட்டது.

நேற்றைய AI நாம் பேசி முடித்த பிறகு பதில் சொன்னது. இன்றைய AI நாம் பேசும்போதே கேட்கிறது. நாளைய AI — நம்முடன் உண்மையாக உரையாடும் டிஜிட்டல் கூட்டாளியாக மாறலாம்.

Spread the love
error: Content is protected !!