Bangla text

বিজয়ে লেখা পুরনো ডকুমেন্টে সার্চ কাজ করে না কেন?

বিজয় লেখায় বাংলা অক্ষর জমা থাকে না, থাকে ইংরেজি অক্ষর; তাই বাংলায় টাইপ করে খুঁজলে মেলে না। পুরনো ফাইলগুলো একবার ইউনিকোডে রূপান্তর করে সেটাকেই মূল কপি হিসেবে রাখুন, আর প্রেসের জন্য বিজয় লাগলে প্রতিবার সেই মূল কপি থেকে বানান।

পড়তে সময় লাগবে প্রায় ৪ মিনিট

কয়েক বছর আগের একটা নোটিশ দরকার। মনে আছে, ভেতরে "কর্তৃপক্ষ" শব্দটা ছিল। ফোল্ডারে শ'খানেক ফাইল। ওয়ার্ডে Ctrl+F চেপে লিখলেন, কিছু পাওয়া গেল না। কম্পিউটারের ফাইল সার্চেও কিছু এল না। অথচ ফাইল খুললে শব্দটা চোখের সামনেই আছে।

ফাইলগুলো বিজয়ে লেখা হলে এটাই হওয়ার কথা।

কেন এমন হয়

বিজয়ে টাইপ করলে বাংলা অক্ষর জমা হয় না। জমা হয় ইংরেজি অক্ষর আর চিহ্ন, আর সুতনি এমজে (SutonnyMJ) ফন্ট সেগুলোকে বাংলা করে আঁকে। "প্রকাশিত" ফাইলের ভেতরে আসলে cÖKvwkZ। আজকের কিবোর্ডে, ফোনে বা ইউনিকোডে "প্রকাশিত" লিখে খুঁজলে সার্চ খোঁজে বাংলা অক্ষর। ফাইলে আছে ইংরেজি অক্ষর। মিল হয় না।

একই সমস্যা সব জায়গায়:

  • ওয়ার্ড আর এক্সেলের Ctrl+F।
  • কম্পিউটারের ফাইল সার্চ, যা ফাইলের ভেতরের লেখা খোঁজে।
  • বিজয় ফাইল থেকে বানানো পিডিএফ। পিডিএফের ভেতরের লেখাও বিজয় কোডে থাকে।
  • ইমেইলে পাঠানো বিজয় লেখা, বা ওয়েবসাইটে দেওয়া বিজয় নোটিশ।

আরও কঠিন: একই শব্দ, একাধিক কোড

কেউ ভাবতে পারেন, তাহলে বিজয় কোড দিয়েই খুঁজি। মাঝে মাঝে কাজ করে, কিন্তু ভরসা করা যায় না। কারণ বিজয়ে একই শব্দ কয়েক রকমভাবে জমা থাকতে পারে। "কর্তৃপক্ষ" শব্দটাই অন্তত তিন রকমভাবে থাকতে পারে:

যেভাবে জমা আছেকেন আলাদা
KZ©…c¶ঋ-কারের আগে রেফ, পুরনো ক্ষ
KZ…©cÿঋ-কারের পরে রেফ, নতুন ক্ষ
KZ©„cÿঋ-কারের আগে রেফ, ঋ-কারের অন্য আকার, নতুন ক্ষ

সুতনি এমজেতে তিনটাই হুবহু "কর্তৃপক্ষ"। কিন্তু সার্চের কাছে তিনটা আলাদা শব্দ। একটা দিয়ে খুঁজলে বাকি দুটো বাদ পড়ে। কেন এক শব্দের এত রূপ, তা বিস্তারিত এখানে: পুরনো বিজয় আর নতুন বিজয় কোড।

ইউনিকোডে এই ঝামেলা নেই। সেখানে "কর্তৃপক্ষ" একভাবেই জমা থাকে।

সাময়িক উপায়: বিজয় কোড দিয়ে খোঁজা

আজই একটা ফাইল খুঁজে বের করা দরকার হলে:

  1. ইউনিকোড থেকে বিজয় বক্সে শব্দটা লিখুন।
  2. যে বিজয় কোড আসে, সেটা কপি করুন।
  3. ওয়ার্ডে Ctrl+F চেপে সেই কোড দিয়ে খুঁজুন।

মনে রাখবেন, ওপরের কারণে এতে কিছু জায়গা বাদ পড়তে পারে। ছোট, সাধারণ শব্দে ভালো কাজ করে। যুক্তাক্ষর, রেফ বা ক্ষ-ওয়ালা শব্দে ফসকে যাওয়ার সম্ভাবনা বেশি।

স্থায়ী সমাধান: একবার রূপান্তর, একটা ইউনিকোড মূল কপি

বারবার কোড দিয়ে খোঁজার চেয়ে একবার বসে পুরনো ফাইলগুলো ইউনিকোডে বদলে ফেলাই ভালো।

  1. আসল ফাইলগুলো আলাদা ফোল্ডারে রেখে দিন। কিছুতে হাত দেবেন না। কিছু গোলমাল হলে এগুলোই ভরসা।
  2. ওয়ার্ড, এক্সেল, পাওয়ারপয়েন্ট ফাইল (.docx, .xlsx, .pptx) একে একে বিজয় থেকে ইউনিকোড টুলে দিন। টুল শুধু বিজয় ফন্টের লেখা ইউনিকোডে বদলায়, ইংরেজি লেখায় হাত দেয় না, আর বদলানো লেখার ফন্ট করে দেয় Nirmala UI। পুরনো .doc বা .xls হলে আগে ওয়ার্ড বা এক্সেলে খুলে .docx বা .xlsx হিসেবে সেভ করে নিন।
  3. পিডিএফ ফাইল টুলের পিডিএফ অংশে দিন। টুল পিডিএফের ভেতরের লেখা পড়ে, বিজয় ফন্টের লেখা ইউনিকোডে বদলায়। ফলাফল কপি করতে পারেন, বা .txt কিংবা .docx হিসেবে নামাতে পারেন। সেই .docx-টা পিডিএফের পাশেই রেখে দিন। এটাই হবে খোঁজার কপি।
  4. নাম দেখে যেন চেনা যায়। যেমন নামের শেষে "unicode" জুড়ে দিন: notice-2019-unicode.docx।
  5. মিলিয়ে দেখুন। নতুন ফাইলে Ctrl+F চেপে ইউনিকোডে একটা শব্দ লিখুন। এবার পাওয়ার কথা।

আপনার ফাইল এই ব্রাউজারেই থাকে। আমাদের সার্ভারে কিছু যায় না।

কোন ফাইল আগে বদলাবেন

সব পুরনো ফাইল এক দিনে বদলানোর দরকার নেই। যেগুলো বেশি কাজে লাগে, সেগুলো দিয়ে শুরু করুন:

  • চিঠি আর নোটিশের ছক (টেমপ্লেট)। অফিসের চিঠির ছকটা বিজয়ে থাকলে প্রতিটা নতুন চিঠিও বিজয়ে জন্ম নেয়। ছকটা একবার ইউনিকোডে বদলালে সমস্যার উৎসটাই বন্ধ হয়।
  • যে তালিকা বারবার খোঁজেন। কর্মচারী, শিক্ষার্থী, গ্রাহক বা সদস্যের তালিকা। এগুলোতেই সার্চ আর সর্ট সবচেয়ে বেশি লাগে।
  • যে ফাইল বাইরে পাঠাতে হয়। ইমেইলে বা অনলাইনে যা যায়, তা ইউনিকোডে থাকলে প্রাপকের কম্পিউটারে সুতনি এমজে না থাকলেও ঠিক দেখায়।
  • বাকি পুরনো ফাইল। এগুলো ধীরে ধীরে, যখন যেটা খোলা লাগে তখন সেটা।

এরপর থেকে নিয়ম একটাই

সংশোধন, নতুন সংস্করণ, সব কাজ হবে ইউনিকোড কপিতে। প্রেসের জন্য বিজয় লাগলে প্রতিবার সেই ইউনিকোড কপি থেকে ইউনিকোড থেকে বিজয় দিয়ে নতুন করে বানান। বিজয় কপিতে সরাসরি সংশোধন করবেন না। করলে দুটো কপি দুই রকম হয়ে যায়, আর কয়েক মাস পরে কেউ বলতে পারে না কোনটা ঠিক।

সাবধানতা ও সীমা

  • স্ক্যান করা পিডিএফ। কাগজ স্ক্যান করে বানানো পিডিএফে লেখা থাকে না, থাকে শুধু ছবি। এই টুল সেখান থেকে কিছু পড়তে পারবে না। পিডিএফে কোনো শব্দ সিলেক্ট করা যায় কি না দেখে নিন। না গেলে সেটা ছবি।
  • পিডিএফের সাজ নয়, লেখা। পিডিএফ থেকে যা পাবেন, তা মূলত লেখা। পাতার হুবহু সাজ আশা করবেন না। খোঁজা আর কপি করার জন্য সেটাই যথেষ্ট।
  • অচেনা অক্ষর। টুল কোনো চিহ্ন চিনতে না পারলে সেটা ফেলে না দিয়ে দাগিয়ে দেখায়। দাগানো জায়গাগুলো মূল ফাইলের সাথে মিলিয়ে ঠিক করুন।
  • কঠিন শব্দে চোখ বুলান। রূপান্তরের পর কয়েকটা যুক্তাক্ষরওয়ালা শব্দ দেখে নিন, বিশেষ করে সরকারি কাগজে যেগুলো বারবার আসে: কর্তৃপক্ষ, সংক্রান্ত, প্রকাশিত।

এক্সেলের তালিকায় একই সমস্যা হলে, সাজানোর (সর্ট) ঝামেলাসহ, এখানে দেখুন: এক্সেলে বিজয়ে লেখা নাম-ঠিকানা ইউনিকোডে।

যা প্রায়ই জানতে চাওয়া হয়

ওয়ার্ডে বাংলা শব্দ Ctrl+F দিয়ে খুঁজে পাই না কেন?

ফাইলটা বিজয়ে লেখা হলে ভেতরে বাংলা অক্ষর নেই, আছে ইংরেজি অক্ষর। আপনি বাংলায় লিখে খুঁজছেন, তাই মিল হচ্ছে না। ফাইলটা ইউনিকোডে রূপান্তর করলে তারপর থেকে বাংলায় লিখেই খোঁজা যাবে।

বিজয় কোড দিয়ে খুঁজলে হবে না?

কখনো হয়, কিন্তু ভরসা করা যায় না। বিজয়ে একই শব্দ কয়েক রকম কোডে জমা থাকতে পারে, যেমন “কর্তৃপক্ষ” অন্তত তিন রকম। একটা দিয়ে খুঁজলে বাকিগুলো বাদ পড়ে।

পুরনো ফাইল রূপান্তর করলে আসলটা কি বদলে যায়?

না। টুল একটা নতুন ফাইল বানিয়ে দেয়, যা আপনি ডাউনলোড করেন। আসলটা যেমন ছিল থাকে। তবু আসল ফাইলগুলো আলাদা ফোল্ডারে রেখে দেওয়াই ভালো।

বিজয় লেখা পিডিএফ কি সার্চ করার মতো বানানো যায়?

লেখাওয়ালা পিডিএফ হলে টুলের পিডিএফ অংশে দিন। বিজয় লেখা ইউনিকোডে বদলে .docx বা .txt হিসেবে পাবেন, সেটায় বাংলায় লিখে খোঁজা যায়। স্ক্যান করা পিডিএফে লেখা থাকে না, তাই সেখানে এটা কাজ করে না।

প্রেসের জন্য তো বিজয় লাগবে, তাহলে ইউনিকোড রাখব কেন?

ইউনিকোড কপিটাই মূল কপি হিসেবে রাখুন। প্রেসের দরকার হলে প্রতিবার সেখান থেকে ইউনিকোড থেকে বিজয় টুলে বিজয় কপি বানিয়ে নিন। তাতে দুটো কপি কখনো আলাদা হয়ে যায় না।