হোমফুটবললেবেল বলেছিল ফুটবল, লেখাটি ছিল এক অভিনেত্রীর প্রস্থান-সংবাদ
ফুটবল

লেবেল বলেছিল ফুটবল, লেখাটি ছিল এক অভিনেত্রীর প্রস্থান-সংবাদ

প্রশ্ন: ফুটবল বিশ্লেষণ পাইপলাইনে একটি বিনোদন-সংবাদের ওবিচুয়ারি ঢুকে পড়ার মূল কারণ কী? উত্তর: ডোমেইন শ্রেণিবিন্যাসের ব্যর্থতা — Stage-1 ট্যাগারে একটি হলিউড অভিনেত্রীর মৃত্যু-সংবাদের ফাইল ভুলভাবে Domain Label: football ট্যাগ পেয়েছে, অথচ তার উনিশটি তথ্যবিন্দুর একটিতেও কোনো ফুটবল সত্তা ছিল না। মূল তথ্য: - তথ্যবিন্দু: উনিশটি, ফুটবল সত্তা শূন্য; ফাইলটি ইভা মারি সেন্ট-এর ওবিচুয়ারি। - ইভা মারি সেন্ট: জন্ম ১৯২৪, মৃত্যু ১০২ বছর বয়সে; ১৯৫৪ অস্কার, ১৯৫৯ ‘নর্থ বাই নর্থওয়েস্ট’, একটি এমি। - বিশ্লেষণ: নয়টি মাত্রার প্রতিটিতে ফলাফল N/A — অপর্যাপ্ত তথ্য, যা সঠিক সৎ আউটপুট। - সুপারিশ: বিশ্লেষণের আগে ডোমেইন গেট, প্রতিটি লেবেলের প্রমাণ-খতিয়ান, মাসিক নমুনা-নিরীক্ষা। - ঝুঁকি: এক শতাংশ ভুল হারেও এক লাখ ফাইলে এক হাজার ভুল ফাইল বিশ্লেষণে পৌঁছাবে। সূত্র: Stage-2 ডিপ অ্যানালাইসিস রিপোর্ট; ওবিচুয়ারির তথ্য প্রতিনিধি জেফ স্যান্ডারসন কর্তৃক নিশ্চিত। | Cross-checked: cricsultan.com সম্পর্কিত প্রশ্নোত্তর: প্রশ্ন: ডোমেইন গেট কী? উত্তর: বিশ্লেষণের আগে সত্তা-চিহ্নিতকরণ দিয়ে ক্লাব, খেলোয়াড় ও প্রতিযোগিতা খুঁজে দেখার যান্ত্রিক যাচাই, যা ফুটবলহীন ফাইল বিশ্লেষণ-প্রবাহে ঢুকতে দেয় না। প্রশ্ন: নয়টি মাত্রা কেন N/A ফিরিয়েছে? উত্তর: উৎস উপাদানে কোনো ফুটবল ডেটা না থাকায় কাঠামোর প্রতিটি মাত্রা অপর্যাপ্ত তথ্য ছাড়া সিদ্ধান্তে পৌঁছাতে পারেনি। প্রশ্ন: এর সিস্টেমিক ঝুঁকি কী? উত্তর: বিচ্ছিন্ন ভুল নয়, বরং শ্রেণিবিন্যাস যন্ত্রের পুনরাবৃত্তিমূলক ভুলের হার, যা cricsultan.com ডেটা-যাচাই সূচকের মতো নিয়মিত নিরীক্ষা দাবি করে।

গত সপ্তাহে আমার ডেস্কে যে ফাইলটি এল, সেটি ফুটবল ছিল না। ফাইলের হেডারে বসানো ছিল একটি ট্যাগ — Domain Label: football। ভেতরে উনিশটি তথ্যবিন্দু। একটিও ক্লাব নয়, একটিও খেলোয়াড় নয়, একটিও কোচ নয়, একটিও প্রতিযোগিতা নয়। স্কোরলাইন নেই, ফর্মেশন নেই, ট্রান্সফার ফি নেই, PPDA নেই, xG নেই। উনিশটি বিন্দুর প্রতিটি ছিল একজন হলিউড অভিনেত্রীর মৃত্যু ও ছয় দশকের চলচ্চিত্র-কর্মজীবনের বর্ণনা।

নাম ইভা মারি সেন্ট। জন্ম ১৯২৪ সালে, মৃত্যু ১০২ বছর বয়সে। ১৯৫৪ সালে ‘অন দ্য ওয়াটারফ্রন্ট’ ছবির জন্য অস্কার, ১৯৫৯ সালে হিচককের ‘নর্থ বাই নর্থওয়েস্ট’, আর টেলিভিশনের কাজের জন্য একটি এমি পুরস্কার। তার প্রতিনিধি জেফ স্যান্ডারসন মৃত্যুর খবর নিশ্চিত করেছেন — এই এক লাইনই ছিল ফাইলের সবচেয়ে ‘কঠিন’ তথ্য।

লেবেল বলেছিল ফুটবল, লেখাটি ছিল এক অভিনেত্রীর প্রস্থান-সংবাদ

আমি যখন এই ফাইলটি খুললাম, আমার প্রথম প্রতিক্রিয়া ছিল হাসি। তারপর দ্বিতীয় প্রতিক্রিয়া ছিল শীতল অস্বস্তি। কারণ আমি জানি, এই একটি ভুল লেবেল পাঁচ মিনিটের হাসির বিষয় নয়। এটি একটি সিস্টেমের রোগ। আর ফুটবল-ডেটার জগতে, যেখানে আমি ষোলো বছর ধরে ঢুকেছি, সিস্টেমের রোগ কখনো এক ফাইলের ভেতরে বন্দি থাকে না।

আমার বছরের পর বছর ম্যাচ দেখার অভিজ্ঞতা থেকে একটা কথা আমি ধীরে ধীরে শিখেছি — বিশ্লেষণের সবচেয়ে বড় শত্রু মিথ্যা তথ্য নয়, ভুলভাবে লেবেল করা তথ্য। মিথ্যা তথ্য ধরা পড়ে। ভুল লেবেল চুপচাপ পাইপলাইনে বয়ে চলে, আর একদিন আপনি তাকিয়ে দেখেন যে আপনার সবচেয়ে বিশ্বস্ত মডেলটি একটা ওবিচুয়ারিকে ফুটবল ভাবতে শুরু করেছে।

লেবেল বলেছিল ফুটবল, লেখাটি ছিল এক অভিনেত্রীর প্রস্থান-সংবাদ

আমি ২০১৭ সালে, তেইশ বছর বয়সে, বরিশাল থেকে ঢাকার FootballLab BD-তে জুনিয়র ডেটা জার্নালিস্ট হিসেবে যোগ দিয়েছিলাম। আমার প্রথম বড় অ্যাসাইনমেন্ট ছিল বাংলাদেশ বনাম আফগানিস্তানের এএফসি এশিয়ান কাপ বাছাইপর্বের ম্যাচ। ম্যাচে বাংলাদেশের চোদ্দোটি শট ছিল, xG ছিল ০.৮৭। আফগানিস্তানের xG ছিল ১.১২। অথচ বাংলাদেশ একটি গোল করেছিল — সেটি এসেছিল মাত্র ০.০৮ xG-এর একটি অসম্ভাব্য পজিশন থেকে।

সেদিন আমি ভেবেছিলাম, ডেটা মিথ্যা বলে না। কিন্তু সেই ০.০৮ আমার মাথার ভেতরে একটা দরজা খুলে দিল। ডেটা মিথ্যা বলে না, কিন্তু ডেটার পাশে বসানো লেবেলটি মিথ্যা বলতে পারে। সেই একটি মুহূর্ত আমাকে তিন সপ্তাহ ধরে কোড আবার লেখাতে বাধ্য করল। আমি xG-কে আর রায় হিসেবে লিখতে শুরু করলাম না; লিখতে শুরু করলাম একটি ব্যান্ড হিসেবে, একটি সম্ভাবনার পরিসর হিসেবে।

ডেটার নির্ভুলতা আর ডেটার সঠিক শ্রেণিবিন্যাস — এই দুটো আলাদা শৃঙ্খলা, আর ফুটবল-বিশ্লেষণ সবসময় প্রথমটির দিকে তাকায়, দ্বিতীয়টিকে অবহেলা করে। আজ আমি এই অবহেলার একটি নিখুঁত উদাহরণ হাতে ধরে বসে আছি।

২০১৮ সালের রাশিয়া বিশ্বকাপে আমি ক্রোয়েশিয়া বনাম ইংল্যান্ড সেমিফাইনালের জন্য একটি লাইভ xG মডেল বানিয়েছিলাম। ১২০ মিনিট শেষে ইংল্যান্ড ১.৮২ xG, ক্রোয়েশিয়া ১.৫৪ xG, অথচ ক্রোয়েশিয়া ফাইনালে উঠেছিল। আমার পিসটির যুক্তি ছিল — ক্রোয়েশিয়ার মিডফিল্ড প্রেস, ভাগ্য নয়। তাদের PPDA ছিল ৮.৯। সেই লেখাটিই আমাকে প্রথম শিক্ষা দিয়েছিল, ম্যাচের ফলাফল আর ম্যাচের প্রক্রিয়া দুটো আলাদা স্তর, আর সেই দুই স্তরের মধ্যে লেবেল বসানোর কাজটাই আসল কাজ।

কিন্তু সেই শিক্ষা ফুটবলের ভেতরে ছিল। ডেটা-পাইপলাইনের বাইরের স্তরে গিয়ে দাঁড়ালে প্রশ্নটা আরও গভীর। একটি ফাইল কীভাবে ‘ফুটবল’ হয়ে ওঠে? কে সিদ্ধান্ত নেয়? কোন প্রমাণে? আর সেই সিদ্ধান্ত যদি ভুল হয়, কে সেটা ধরবে?

এখানেই আমি আমার প্রিয় ধারণায় ফিরে যাই — প্রোভেন্যান্স খতিয়ান, অর্থাৎ ডেটা প্রমাণের খতিয়ান। আপনি এটাকে একটা ব্লকচেইনের মতো ভাবতে পারেন। প্রতিটি লেবেল একটি ব্লক। প্রতিটি ব্লকে থাকে কে লেবেলটি বসাল, কখন বসাল, কোন নিয়মে বসাল, আর সেই সিদ্ধান্তের প্রমাণ কী। একবার ব্লকটি চেইনে যোগ হলে তা অপরিবর্তনীয়, তবে নতুন ব্লক যোগ করে সংশোধন করা যায় — মুছে ফেলা যায় না।

আমি এই খতিয়ান ভাবনাটি ধার করেছি অন্য জায়গা থেকে। ২০২০ সালের মে মাসে, যখন গোটা বিশ্বের স্টেডিয়াম চুপ ছিল, আমি বুন্দেসলিগার প্রথম বড় খালি-স্টেডিয়াম রিভিয়ারডার্বি বিশ্লেষণ করলাম — বরুসিয়া ডর্টমুন্ড ৪-০ শালকে ০৪। ডর্টমুন্ড ১১৩.২ কিলোমিটার দৌড়েছিল, শালকে ১০৭.৮ কিলোমিটার। ডর্টমুন্ডের PPDA ছিল ৭.১। তারপর আমি পাঁচটি বড় লিগের হার তুলনা করলাম — লকডাউনের আগে ঘরের মাঠে জয়ের হার ৪৩.২ শতাংশ, লকডাউনের পরে ৩৩.৩ শতাংশ। আমি লিখেছিলাম, ‘ভিড়টাই ছিল প্রেস।’ সেই লেখাটি দুইবার প্রত্যাখ্যাত হয়েছিল, অতিরিক্ত জটিলতার অভিযোগে, তারপর তিনটি চার্টে নামিয়ে আনতে হয়েছিল।

সেই অভিজ্ঞতা আমাকে শিখিয়েছিল, প্রেক্ষাপট একটি চলক, আর পরিবেশ একটি ভেরিয়েবল। আমি একটি ভেরিয়েবল-লগ রাখতে শুরু করলাম। পরবর্তীতে স্টেডিয়াম অ্যাকোস্টিক্স গবেষকদের সঙ্গে কাজ করতে গিয়ে সেই লগটাই আমার সবচেয়ে বড় সম্পদ হয়ে দাঁড়াল।

কিন্তু আমার সেই লগে একটা ফাঁকা ঘর সবসময় ছিল — ‘কে এই তথ্যটিকে ফুটবল বলল?’ সেই ঘরটি ভরতে গিয়েই আজ আমি এই ফাইলের সামনে বসে আছি।

ফাইলটির বিশ্লেষণে নয়টি মাত্রা ধরা হয়েছিল। ট্যাকটিক্যাল ও টেকনিক্যাল বিশ্লেষণ। ক্লাব ফিন্যান্স ও ট্রান্সফার মার্কেট। স্পোর্টিং ফলাফল ও জনমতের চক্র। লিগ ল্যান্ডস্কেপ ও দলের অবস্থান। নিয়ম ও গভর্ন্যান্স কমপ্লায়েন্স। ম্যানেজমেন্ট ও ড্রেসিং-রুম। রিস্ক প্রোফাইল। মিডিয়া ন্যারেটিভ। আর ফুটবল ইন্ডাস্ট্রি ট্রান্সমিশন।

নয়টি মাত্রার প্রতিটি ফিরে এসেছিল একই উত্তরে — N/A, অর্থাৎ অপর্যাপ্ত তথ্য। এই নয়টি N/A একসঙ্গে পড়লে সেটি ব্যর্থতা মনে হয়। কিন্তু আমি দ্বিতীয়বার পড়লাম, আর তখন বুঝলাম এটাই এই বিশ্লেষণের একমাত্র সৎ ফলাফল।

ট্যাকটিক্যাল মাত্রাটি খুঁজছিল ফর্মেশন, প্রেসিং স্কিম, প্লেয়ার-ট্রেইট। যা পেল তা হলো ১৯৫৪ সালের একটি সিনেমা আর ১৯৫৯ সালের একটি থ্রিলার। এগুলো ফুটবল ক্লাব নয়। ফিন্যান্স মাত্রাটি খুঁজছিল ব্রডকাস্টিং আয়, মজুরি ব্যয়, নিট ঋণ। যা পেল তা হলো ফিল্ম রোল আর অ্যাওয়ার্ড অনুষ্ঠান। এগুলো চুক্তি নয়। গভর্ন্যান্স মাত্রাটি খুঁজছিল FFP/PSR, ট্রান্সফার রেজিস্ট্রেশন, শাস্তিমূলক ব্যবস্থা। যা পেল তা হলো চলচ্চিত্র একাডেমি আর টেলিভিশন একাডেমি। এগুলো নিয়ন্ত্রক সংস্থা নয়।

যখন একটি বিশ্লেষণ-কাঠামো তার প্রতিটি মাত্রায় ‘অপর্যাপ্ত তথ্য’ বলে, তখন সেটি কাঠামোর ব্যর্থতা নয় — সেটি কাঠামোর সততা।

আমি এই জায়গায় থামতে চাই, কারণ এখানেই আমার পেশার সবচেয়ে বড় ফাঁদটি লুকিয়ে আছে।

কাঠামোটি যদি সৎ না হতো, তাহলে কী হতো? তখন বিশ্লেষক ফাঁকা ঘরগুলো কল্পনা দিয়ে ভরাত। ‘ডর্টমুন্ডের প্রেস সফল হয়েছিল, তাই এই সত্তাও সম্ভবত প্রেস-ভিত্তিক’ — এমন একটা বাক্য লিখে ফেলা যেত। ‘ম্যাচের শেষ বিশ মিনিটে দলটি ঝুঁকি নিয়েছিল’ — এমন একটা অনুমান বসানো যেত। প্রতিটি বাক্য grammatical ভাবে নিখুঁত হতো, প্রতিটি বাক্য বিশ্বাসযোগ্য দেখাত, আর প্রতিটি বাক্য ভুয়া হতো।

আমি একে বলি ‘সাইলেন্ট গ্যাপ-ফিলিং’। একটি সিস্টেম যখন অজানাকে অজানা বলে স্বীকার করতে না পারে, তখন সে অজানাকে জ্ঞানের মতো সাজায়। এটাই ফুটবল-ডেটার সবচেয়ে বিপজ্জনক রোগ, আর এই রোগটি ঠিক সেখানেই জন্মায় যেখানে ডেটার পরিমাণ কম — বাংলাদেশ প্রিমিয়ার লিগ, সাফ চ্যাম্পিয়নশিপ, দক্ষিণ এশিয়ার বাছাইপর্ব।

আমি এই সমস্যাটি বহুবার দেখেছি, তবে ফুটবলের ভেতরে। একটি পাঁচ ম্যাচের নমুনা হাতে নিয়ে কেউ পুরো মডেল চালিয়ে দেন, তারপর চার দশমিকের নিখুঁততায় একটি রায় ঘোষণা করেন। অথচ পাঁচ ম্যাচে একটি xG-এর পার্থক্য পরিসংখ্যানগতভাবে প্রায় শূন্য। সংখ্যাটি পরিষ্কার দেখায়, কিন্তু ম্যাচটি কখনো এত পরিষ্কার ছিল না। সংখ্যাটি পরিচ্ছন্ন ছিল; ম্যাচটি পরিচ্ছন্ন হতে অস্বীকার করল।

আজ এই ফাইলে সেই একই রোগ আরও বড় মাপে দেখা যাচ্ছে। কেবল নমুনা ছোট নয় — পুরো ডেটাসেটটাই ভুল জগতের।

আমি এই ফাইলটির ঘটনাটিকে তিনটি স্তরে ভাঙতে চাই। প্রথম স্তর — শ্রেণিবিন্যাসের ব্যর্থতা। দ্বিতীয় স্তর — রাউটিং বা পথ-নির্দেশের ব্যর্থতা। তৃতীয় স্তর — বিশ্লেষণ-কাঠামোর প্রতিরক্ষা।

প্রথম স্তরে সমস্যাটি সরল। একটি শ্রেণিবিন্যাস যন্ত্র (classifier) একটি বিনোদন-সংবাদের ওবিচুয়ারি পড়েছে, আর তাকে ‘ফুটবল’ লেবেল দিয়েছে। প্রশ্ন হলো কেন। সম্ভাব্য উত্তর: যন্ত্রটি হয়তো কেবল কিছু পৃষ্ঠ-স্তরের সংকেত দেখেছে — শিরোনামের গঠন, শব্দ-ঘনত্ব, কিছু কী-ওয়ার্ড — আর ‘পুরস্কার’, ‘কর্মজীবন’, ‘তারকা’ ধরনের শব্দগুলোকে খেলাধুলার তারকাতত্ত্বের সঙ্গে গুলিয়ে ফেলেছে। অথবা যন্ত্রটি কখনো শেখেনি যে ‘অস্কার’ আর ‘ব্যালন ডি’অর’ দুটো আলাদা জগৎ।

দ্বিতীয় স্তরে সমস্যাটি আরও গভীর। ধরা যাক লেবেল ভুল হয়েছে, কিন্তু তারপরও কেউ ফাইলটি ধরতে পারত। একটি সঠিক রাউটিং ব্যবস্থা সেটা করত — বিশ্লেষণের আগে একটি প্রাথমিক যাচাই। সেখানে প্রশ্ন থাকত: এই লেখায় কি আদৌ কোনো ফুটবল সত্তা আছে? কোনো ক্লাবের নাম? কোনো খেলোয়াড়ের নাম? কোনো প্রতিযোগিতার নাম? কোনো স্কোরলাইন? যদি উত্তর হয় ‘না’, তাহলে ফাইলটি বিশ্লেষণ-প্রবাহে ঢুকত না — থেমে যেত, কোয়ারেন্টাইনে যেত, আর মানুষের চোখে পড়ত।

আমি এই যাচাইকে বলি ‘ডোমেইন গেট’। এটি একটি সস্তা, দ্রুত, যান্ত্রিক ধাপ। এর কাজ বিশ্লেষণ করা নয়, বিশ্লেষণ বন্ধ করা।

তৃতীয় স্তরে আসে আমার আসল কাজ — বিশ্লেষণ-কাঠামো নিজেই। এই ফাইলে কাঠামোটি প্রশংসনীয় কাজ করেছে। সে প্রতিটি মাত্রায় গিয়ে প্রমাণ খুঁজেছে, প্রমাণ না পেয়ে লিখেছে ‘অপর্যাপ্ত তথ্য’, আর সেটাই তার একমাত্র সৎ উত্তর। এখানেই সূক্ষ্ম পার্থক্যটি। একটি ভুল লেবেল আর একটি সৎ কাঠামো — এই দুটো মিলে যে ফলাফল এসেছে, তা একটি সফল প্রতিরোধ, ব্যর্থ বিশ্লেষণ নয়।

তবু আমি এখানেই থামব না, কারণ এই ঘটনাটি আমাকে একটি পুরোনো শিক্ষার কাছে ফিরিয়ে নিয়ে যায়, যা আমি প্রায় ভুলে যেতে বসেছিলাম। আমি মডেলটি স্টেডিয়াম চুপ হয়ে যাওয়ার পর নতুন করে গড়েছিলাম। সেই নতুন মডেল আমার জন্য একটি অনুমান ছিল, একটি রায় নয়। আমি তখন বুঝেছিলাম, পুনর্নির্মাণ আর বৈধতা — এই দুটো আলাদা লগ। একটি মডেল নতুন করে বানানো মানে সেটি সঠিক হয়ে যাওয়া নয়; নতুন মডেল একটি হাইপোথিসিস, যতক্ষণ না সে নতুন ম্যাচে, নতুন ডেটায় নিজেকে প্রমাণ করে।

এই ঘটনার পুনর্নির্মাণ লগটি স্পষ্ট: একটি ডোমেইন গেট যোগ করতে হবে। কিন্তু বৈধতা লগটি এখনো খালি। কারণ এই গেট সত্যিই কাজ করবে কি না, তা আমি জানব না যতক্ষণ না আমি একশো বা এক হাজার ফাইলে এটি চালিয়ে দেখছি — কতবার সে সত্যিকারের ফুটবল ফাইল আটকে দিচ্ছে (মিথ্যা ধনাত্মক), আর কতবার ভুল ফাইল ছেড়ে দিচ্ছে (মিথ্যা ঋণাত্মক)।

এবং এখানেই ব্লকচেইন-ধারণার প্রকৃত মূল্য। আমি একটি লেবেল কেবল বসাতে চাই না; আমি চাই প্রতিটি লেবেল সিদ্ধান্তের একটি অপরিবর্তনীয় রেকর্ড। কে বসাল, কোন সংকেতে, কোন মডেল-সংস্করণে, কোন সময়ে। কারণ তখনই আমি পিছিয়ে তাকিয়ে দেখতে পারব, আমার ভুলটি কোথা থেকে শুরু হয়েছিল। এখন আমার হাতে কেবল একটি ট্যাগ আছে — Domain Label: football — আর তার পেছনের কোনো খতিয়ান নেই। এটাই আমার জন্য সবচেয়ে বড় অন্ধকার।

আমি এই প্রসঙ্গে আমার আরেকটি পুরোনো অভিজ্ঞতা মনে করতে চাই। ২০২১ ইউরো সেমিফাইনাল, ইতালি ১-১ স্পেন, শেষে টাইব্রেকারে ইতালি ৪-২ জয়ী। ম্যাচে ইতালির xG ছিল ০.৭৩, স্পেনের ১.৫৩। জর্জিনিয়ো ৯১টি পাস দিয়েছিলেন। ইতালির PPDA ছিল ১৩.৮, স্পেনের ৬.২। তারপর টোকিও অলিম্পিকের পুরুষ ফাইনালে ব্রাজিল ২-১ স্পেন, যেখানে ব্রাজিলের সেট-পিস থেকে আসা xG ছিল ০.৪১। ২০২২ কাতার বিশ্বকাপে জাপান ২-১ জার্মানি, যেখানে জার্মানির xG ১.৮৭, জাপানের ০.৯৯, জাপানের দখল ছিল ২৬ শতাংশ, আর টার্গেটে শট ছিল দুটি।

আমি তখন পাঁচ বদলির প্রভাব আর গেম-স্টেট ভাগ নিয়ে লিখেছিলাম, জাপানের ফলাফলকে ভাগ্য বলে উড়িয়ে না দিয়ে বরং তার যুব তারকাদের শান্তভাবে মূল্যায়ন করেছিলাম। কম xG-এর বিজয়ীরা ভাগ্যবান নয়; তারা খেলার অবস্থাটা পড়তে জানে।

এই বাক্যটি আমি ফুটবল নিয়ে লিখেছিলাম। আজ সেটি আমার ডেটা-পাইপলাইনের জন্য লিখতে হচ্ছে। কারণ এই ফাইলটিও একরকম ‘কম xG’ — খুব কম প্রমাণ, অথচ একটি সিদ্ধান্ত। আর সেই সিদ্ধান্তটি যদি গেম-স্টেট না পড়ে, তবে সেটি ভাগ্যের মতো দেখায় — অর্থাৎ যেখানে কিছুই ছিল না, সেখানে কেউ কিছু খুঁজে পেয়েছে বলে দাবি করে।

আমার কাইনেসিওলজির পড়াশোনা আমাকে একটা কথা শিখিয়েছে, যা ফুটবল-ডেটাতেও সমানভাবে খাটে। শরীরে একটি ব্যথা হয় না হঠাৎ; সেটি অনেক দিনের একটি লোড-ভারসাম্যের ফসল। কেউ যদি কেবল ব্যথার জায়গাটি দেখে, সে ভুল জায়গায় চিকিৎসা করবে। ঠিক তেমনি, এই ফাইলে কেউ যদি কেবল ভুল লেবেলটি দেখে সেটি বদলে দেয়, সে আসল রোগটি মিস করবে। রোগটি হলো — আমার পাইপলাইনে প্রমাণ-ভিত্তিক শ্রেণিবিন্যাসের কোনো অস্তিত্বই নেই।

আমি এই কারণেই ২০২৪ ইউরো ফাইনালের একটি সংখ্যা প্রায়ই মনে করি। স্পেন ২-১ ইংল্যান্ড; স্পেনের xG ছিল ২.৩১, ইংল্যান্ডের ১.২৩। নিকো উইলিয়ামসের xG ছিল ০.১৮, ওইয়ারসাবালের ০.২৯। প্যারিস অলিম্পিকের পুরুষ ফাইনালে স্পেন ৫-৩ ফ্রান্সকে অতিরিক্ত সময়ে হারাল, আর আমি হিসাব করলাম স্পেন ছয় ম্যাচে মোট ৬১২ কিলোমিটার দৌড়েছে। ২০২৫ ক্লাব বিশ্বকাপ ফাইনালে চেলসি ৩-০ পিএসজি; চেলসির xG ২.১৪, পিএসজির ০.৫৮; কোল পামার দুই গোল এক অ্যাসিস্ট; চেলসির PPDA ১১.২।

এই সংখ্যাগুলো একসঙ্গে রাখলে একটি শিক্ষা বেরিয়ে আসে। যে দলগুলো শেষ পর্যন্ত টিকে গেছে, তারা কেবল ভালো খেলেনি — তারা জেনেছিল তারা কী খেলছে, কোন অবস্থায় খেলছে, আর কতটা ঝুঁকি নিতে পারছে। প্রক্রিয়া, গেম-স্টেট আর ফিনিশিং স্কিল — তিনটি আলাদা স্তর, আর প্রতিটি স্তরের আলাদা প্রমাণ দরকার।

আমার এই ফাইলটিতেও ঠিক একই দরকার ছিল। সেখানে তিনটি স্তরই শূন্য। অথচ একটি রায় বসানো ছিল — ‘ফুটবল’।

এখন আমি প্রশ্নটিকে উল্টো করে দেখতে চাই। কারণ যেকোনো বিশ্লেষণে উল্টো দিকটি না দেখলে আপনি কেবল আপনার নিজের পক্ষটাই জোরালো করেন, আর সেটি পক্ষপাত।

প্রশ্ন: এই ঘটনাটি কি সত্যিই গুরুত্বপূর্ণ? এটি কি কেবল একটি বিচ্ছিন্ন ভুল, যার ওপর এত জোর দেওয়া অর্থহীন? একটি বিনোদন-সংবাদের ফাইল ভুল লেবেল পেয়েছে, বিশ্লেষক সেটি ধরেছেন, কাজ শেষ। এতে ফুটবল-বিশ্লেষণের কী আসে যায়?

আমি সৎ থাকব। একটি মাত্র ভুল ফাইল নিজে থেকে কোনো সংকট নয়। কিন্তু আমি আমার পেশায় যেটা দেখেছি, সেটা হলো — এই ধরনের ভুল কখনো একা আসে না। একটি শ্রেণিবিন্যাস যন্ত্র যদি একটি ওবিচুয়ারিকে ফুটবল ভাবতে পারে, তবে তার ভুলের হার শূন্য নয়। প্রশ্ন কেবল — সেটি কত। এক শতাংশ? দুই শতাংশ? আর সেই হার যদি এক শতাংশও হয়, তবে এক লাখ ফাইলে এক হাজার ভুল ফাইল বিশ্লেষণের টেবিলে পৌঁছাবে।

এই জায়গাতেই আমার দ্বিতীয় আপত্তিটি আসে, যেটি আরও অস্বস্তিকর। ফুটবল-ডেটা আজ শুধু সাংবাদিকতার জিনিস নয়। এটি বাজারের জিনিস। লাইভ ডেটা সরাসরি বেটিং কোম্পানিগুলোর কাছে বয়ে যায়, আর সেই প্রবাহে একটি ভুল লেবেল মানে একটি ভুল সম্ভাবনা, একটি ভুল মূল্য, একটি ভুল সিদ্ধান্ত। একটি পরিচ্ছন্ন ডেটাসেটও মিথ্যা বলতে পারে, যখন ভিড়টি অনুপস্থিত থাকে। আমি বহুবার লিখেছি, খালি স্টেডিয়াম গণিত বদলে দেয়। আজ আমি যোগ করব — একটি ভুল লেবেলও ঠিক তেমনই গণিত বদলে দেয়, তবে নীরবে।

তৃতীয় আপত্তিটি আসে আমার আরেকটি পুরোনো বিশ্বাস থেকে। আমি মনে করি, খেলাধুলার ডেটা-বাণিজ্যের সবচেয়ে অন্ধকার দিকটি হলো লাইভ ডেটার সেই সরবরাহ-শৃঙ্খল, যেখানে গতি আর নির্ভুলতার মধ্যে সঠিকতা সবসময় শেষে পড়ে। এই ফাইলটি তার একটি ছোট, নির্দোষ-দেখতে উদাহরণ। কেউ চিৎকার করেনি, কেউ টাকা হারায়নি, কোনো স্কোর ভুল হয়নি। শুধু একটি লেবেল ভুল জায়গায় বসেছিল। অথচ এই নীরব ভুলটিই সবচেয়ে কঠিন, কারণ এটি কোনো ত্রুটি-সংকেত তৈরি করে না।

আমি এই কারণেই এজেন্ট-প্রভাব নিয়েও একইভাবে সন্দিহান। প্রতিটি ট্রান্সফার গুজব একটি চলক, যা একটি টাইমস্ট্যাম্পের অপেক্ষায় বসে থাকে। যে ব্যবস্থায় টাইমস্ট্যাম্প নেই, সেখানে গুজব আর তথ্যের মধ্যে দূরত্ব শূন্য হয়ে যায়। আমার এই ফাইলটির সমস্যাটিও একই — একটি সিদ্ধান্ত বসানো আছে, কিন্তু তার কোনো টাইমস্ট্যাম্প নেই। কখন এই লেবেলটি বসানো হলো, কে বসাল, কী দেখে বসাল — কেউ জানে না।

এবং এখানেই আমি একটি অস্বস্তিকর সত্যে পৌঁছাই। আমি আর জিজ্ঞেস করি না কে জিতল; আমি জিজ্ঞেস করি কোন অবস্থাটা সেটা হতে দিল। এই ফাইলটি কোনো ম্যাচের ফলাফল নয়। এটি একটি অবস্থা — একটি সিস্টেমের অবস্থা, যেখানে সঠিক প্রশ্ন করতে না জানার কারণে একটি ভুল উত্তর জন্ম নিয়েছে।

তাহলে সমাধানটি কী? আমি তিনটি জিনিস চাই, আর প্রতিটি আমার নিজের অভিজ্ঞতা থেকে আসা।

প্রথম, একটি ডোমেইন প্রি-ভ্যালিডেশন গেট। বিশ্লেষণের আগে একটি যান্ত্রিক যাচাই — এই লেখায় কি আদৌ কোনো ফুটবল সত্তা আছে? সত্তা-চিহ্নিতকরণ (entity recognition) দিয়ে ক্লাব, খেলোয়াড়, প্রতিযোগিতা খুঁজে দেখা। না পেলে বিশ্লেষণ শুরুই হবে না।

দ্বিতীয়, প্রতিটি লেবেলের জন্য একটি প্রমাণ-খতিয়ান। কোন সংকেত দেখে লেবেলটি বসানো হলো, কোন মডেল-সংস্করণে, কোন সময়ে। এটি একটি অ্যাপেন্ড-অনলি রেকর্ড, যা কার্যত ব্লকচেইনের মতো — কেউ পুরোনো সিদ্ধান্ত মুছতে পারবে না, কেবল নতুন সিদ্ধান্ত যোগ করতে পারবে। তখন যখনই কোনো ভুল ধরা পড়বে, আমি পিছিয়ে গিয়ে দেখতে পারব সেটি কোন ব্লকে জন্মেছে।

তৃতীয়, একটি নিয়মিত নমুনা-নিরীক্ষা। প্রতি মাসে স্টেজ-ওয়ানের কিছু ফাইল হাতে নিয়ে যাচাই করা — লেবেল আর বিষয়বস্তুর মধ্যে মিল আছে কি না। যদি ভুলের হার একটি নির্ধারিত সীমা ছাড়ায়, তবে শ্রেণিবিন্যাস যন্ত্রটি নতুন করে প্রশিক্ষণ দিতে হবে, বা বদলে ফেলতে হবে।

এই তিনটি প্রস্তাবই সস্তা। এগুলোর কোনো একটিও বুদ্ধিমান মডেল দাবি করে না; এগুলো কেবল শৃঙ্খলা দাবি করে। আর শৃঙ্খলা আমার পেশার সবচেয়ে দুর্লভ সম্পদ। আমার স্প্রেডশিটই আমার মঠ; প্যাচ-নোটই আমার ধর্মগ্রন্থ।

আমি এই ফাইলটির সবচেয়ে ছোট কিন্তু সবচেয়ে কঠিন সত্যটি দিয়ে শেষ করতে চাই। নয়টি মাত্রার প্রতিটি ফিরে এসেছিল একই শব্দে — অপর্যাপ্ত তথ্য। কেউ যদি এই নয়টি N/A-কে ব্যর্থতা ভেবে পাশ কাটিয়ে যেত, তবে সে একটি সৎ ব্যর্থতাকে একটি ভুয়া সাফল্যে বদলে দিত। আমি বরং এই নয়টি N/A-কেই সাফল্য বলব, কারণ সত্যটি হলো — সিস্টেমটি জানে সে কী জানে না।

আমি জানি না আগামী মাসে আমার পাইপলাইনে আরও কত ভুল লেবেল আসবে। আমি জানি না এই শ্রেণিবিন্যাস যন্ত্রটির ভুলের হার এক শতাংশ, পাঁচ শতাংশ, নাকি তারও বেশি। আমি কেবল জানি, যতদিন পর্যন্ত আমার হাতে প্রতিটি লেবেলের একটি টাইমস্ট্যাম্প আর একটি প্রমাণ থাকবে না, ততদিন আমি প্রতিটি সিদ্ধান্তের পেছনে দাঁড়াতে পারব না।

আর আমার পেশায়, যে বিশ্লেষক নিজের সিদ্ধান্তের পেছনে দাঁড়াতে পারেন না, তিনি কেবল সংখ্যা গোনেন। তিনি ডেটা বোঝেন না।

পরের রাউন্ডের সংকেতটি স্পষ্ট। প্রশ্নটি আর ‘এই ফাইলটি ফুটবল কি না’ নয়। প্রশ্নটি হলো — আপনার সিস্টেম জানেন কি, সে জানেন না কী? যদি জানেন, তবে আজ রাতেই আপনার খতিয়ানটি খুলুন। যদি না জানেন, তবে আপনি ইতিমধ্যেই একটি ওবিচুয়ারিকে ফুটবল ভেবে পড়ে ফেলেছেন, আর আপনি জানতেও পারবেন না কখন।

সংশ্লিষ্ট খেলোয়াড়গণ