প্রযুক্তি

মস্তিষ্ক থেকে কণ্ঠে রূপান্তরের অগ্রগতিটি নির্ভুলতা নয়—আট সেকেন্ডের দেরি প্রায় শূন্যে নামিয়ে আনা

নেচার নিউরোসায়েন্সে স্ট্রিমিং নিউরোপ্রস্থেসিস প্রকাশ করেছে ইউসি বার্কলি ও ইউসিএসএফের দল। আগের ব্যবস্থা পুরো বাক্য বিশ্লেষণ করে তবে বলত; এটি স্ট্রিম করে, যা কথোপকথন সম্ভব করে।

মস্তিষ্ক থেকে কণ্ঠে রূপান্তরের অগ্রগতিটি নির্ভুলতা নয়—আট সেকেন্ডের দেরি প্রায় শূন্যে নামিয়ে আনা

ইউসি বার্কলি ও ইউসি সান ফ্রান্সিসকোর গবেষকেরা নেচার নিউরোসায়েন্সে এমন একটি ব্রেন-টু-ভয়েস ব্যবস্থা প্রকাশ করেছেন, যা তীব্র পক্ষাঘাতে আক্রান্ত একজনের কথা ফিরিয়ে দেয়। গবেষণাপত্রটির নাম "এ স্ট্রিমিং ব্রেন-টু-ভয়েস নিউরোপ্রস্থেসিস টু রিস্টোর ন্যাচারালিস্টিক কমিউনিকেশন"।

প্রায় প্রতিটি শিরোনামই একে দেখিয়েছে চিন্তা পড়তে শেখা যন্ত্র হিসেবে। প্রকৃত অগ্রগতিটি আরও নির্দিষ্ট, আর যাঁরা এটি ব্যবহার করবেন তাঁদের কাছে আরও গুরুত্বপূর্ণ।

যে সমস্যার সমাধান হলো

আগের স্পিচ নিউরোপ্রস্থেসিসগুলো কাজ করত—এই অর্থে যে সেগুলো সঠিক শব্দই তৈরি করত। যা পারত না, তা হলো সময়মতো তৈরি করা। আগের পদ্ধতিতে কেউ কথা বলার চেষ্টা করা আর শব্দ বেরোনোর মধ্যে দেরি ছিল প্রায় আট সেকেন্ড।

কথোপকথনের পক্ষে আট সেকেন্ড মারাত্মক। মানুষের পালা বদল চলে কয়েক শ মিলিসেকেন্ডের ফাঁকে; আট সেকেন্ডে অন্যজন ধরে নিয়েছেন আপনার বলা শেষ, নিজের প্রশ্নের উত্তর নিজেই দিয়ে দিয়েছেন, কিংবা অন্য প্রসঙ্গে চলে গেছেন। নিখুঁত শব্দ-নির্ভুলতা আর আট সেকেন্ড দেরিওয়ালা ব্যবস্থা চমৎকার একটি প্রতিলিপি-যন্ত্র, কণ্ঠ নয়।

নতুন ব্যবস্থাটি স্ট্রিম করে। পুরো বাক্য বিশ্লেষণ শেষ হওয়ার অপেক্ষা না করে এটি স্নায়ুসংকেত থেকে ধারাবাহিকভাবে, প্রায় রিয়েল টাইমে কথা তৈরি করে।

কীভাবে, আর গবেষকেরা যে তুলনাটি বেছেছেন

পদ্ধতিটি ধার করেছে ভোক্তা-পর্যায়ের বাক্‌-শনাক্তকরণ থেকে। দলটির নিজের বর্ণনা অনুযায়ী, তাঁদের স্ট্রিমিং পদ্ধতি নিউরোপ্রস্থেসিসে নিয়ে আসে "অ্যালেক্সা ও সিরির মতো যন্ত্রের সেই একই দ্রুত বাক্‌-বিশ্লেষণ সক্ষমতা"—একই শ্রেণির অ্যালগরিদম, অডিওর বদলে স্নায়বিক উপাত্তে প্রয়োগ করে প্রায়-সমকালীন কণ্ঠ তৈরি করা।

তুলনাটি কাজের। এটি অগ্রগতিটিকে বসিয়ে দেয় স্নায়ুবিজ্ঞানে নয়, প্রকৌশলে: মস্তিষ্কের সংকেত আগে থেকেই কাজে লাগার মতো করে পড়া হচ্ছিল। বদলেছে বিশ্লেষণের প্রবাহটি, আর তা সম্ভব করেছে মস্তিষ্ক নিয়ে নতুন কোনো বোঝাপড়া নয়—সাধারণ বাক্‌-মডেলিংয়ের অগ্রগতি।

মানুষের মনে থাকা গবেষণাটি থেকে এটি যেভাবে আলাদা

একই প্রতিষ্ঠানগুলোর ব্যাপকভাবে প্রচারিত ২০২৩ সালের কাজের সঙ্গে এটি সহজেই গুলিয়ে যায়—যেখানে ব্রেনস্টেম স্ট্রোকে পক্ষাঘাতগ্রস্ত এক নারীকে দেওয়া হয়েছিল ডিজিটাল অবতার আর তাঁর বিয়ের রেকর্ডিং থেকে বানানো সংশ্লেষিত কণ্ঠ। ওই ব্যবস্থা পুরো শব্দের বদলে ধ্বনিমূল বিশ্লেষণ করত—ইংরেজির জন্য যার দরকার মাত্র ৩৯টি, যা একে দ্রুততর ও নির্ভুলতর করেছিল—আর পৌঁছেছিল মিনিটে প্রায় ৭৮ শব্দে।

২০২৩ সালের ফল প্রতিষ্ঠা করেছিল যে সমৃদ্ধ, ব্যক্তিগতকৃত কথা কাজে লাগার মতো গতিতে বিশ্লেষণ করা যায়। এটি ঠিক করে শব্দটি কখন পৌঁছাবে। দুটি পরিপূরক, আর যেসব প্রতিবেদন দুটিকে মিলিয়ে ফেলে সেগুলো প্রকৃত অগ্রগতির চেয়ে কম অগ্রগতির ধারণা দেয়।

যা নিয়ে সংযত থাকা দরকার

এ ক্ষেত্রের কাজ প্রকাশিত হয় খুব অল্পসংখ্যক অংশগ্রহণকারীর ভিত্তিতে—প্রায়ই একজন—যাঁদের প্রত্যেকের মস্তিষ্কে অস্ত্রোপচার করে ইলেকট্রোড বসানো, আর কাজ চলে গবেষকদের উপস্থিতিতে গবেষণাগারে। এটি সমালোচনা নয়; এ পর্যায়ে গবেষণা চালানোর নৈতিক উপায় এটিই। তবে এর মানে, ফলটি সম্ভাবনা দেখায়—নির্ভরযোগ্যতা নয়।

খোলা প্রশ্নগুলো জৌলুশহীন: ইমপ্ল্যান্টের বিরুদ্ধে কলার প্রতিক্রিয়ায় বছরের পর বছর সংকেত কেমন টেকে, গবেষণাগারের বাইরে এটি কেমন করে, অস্ত্রোপচার কে করবেন, আর এসবের খরচ কত। যে প্রযুক্তি কথা ফিরিয়ে দেয় অথচ বিশ্বজুড়ে কয়েক ডজন মানুষের নাগালে, তা বৈজ্ঞানিক অর্জন—এখনো চিকিৎসা নয়।

সূত্র: নেচার নিউরোসায়েন্সে প্রকাশিত গবেষণাপত্র; ইউসি বার্কলি ইঞ্জিনিয়ারিং; ইউসিএসএফ; নিউরোসায়েন্স নিউজ; আর প্রথম আলোর মূল প্রতিবেদন।

সূত্র: Nature Neuroscience, UC Berkeley, UCSF, Neuroscience News, Prothom Alo

লিখেছেন

Zayed

টেক বিডির কৃত্রিম বুদ্ধিমত্তা বিভাগ লেখেন জায়েদ — নতুন মডেল, এআই নিরাপত্তাবিষয়ক গবেষণা আর সেগুলো ঘিরে গড়ে ওঠা নিয়ন্ত্রণ। কোনো ব্যবস্থা কী দেখাতে পারে তার চেয়ে বাংলাদেশে ব্যবহারকারীর জন্য তা কী বদলায়, সেদিকেই তাঁর আগ্রহ। লেখেন ইংরেজি ও বাংলা দুই ভাষাতেই।