Bangla text
বিজয়ে লেখা পুরনো ডকুমেন্টে সার্চ কাজ করে না কেন?
বিজয় লেখায় বাংলা অক্ষর জমা থাকে না, থাকে ইংরেজি অক্ষর; তাই বাংলায় টাইপ করে খুঁজলে মেলে না। পুরনো ফাইলগুলো একবার ইউনিকোডে রূপান্তর করে সেটাকেই মূল কপি হিসেবে রাখুন, আর প্রেসের জন্য বিজয় লাগলে প্রতিবার সেই মূল কপি থেকে বানান।
কয়েক বছর আগের একটা নোটিশ দরকার। মনে আছে, ভেতরে "কর্তৃপক্ষ" শব্দটা ছিল। ফোল্ডারে শ'খানেক ফাইল। ওয়ার্ডে Ctrl+F চেপে লিখলেন, কিছু পাওয়া গেল না। কম্পিউটারের ফাইল সার্চেও কিছু এল না। অথচ ফাইল খুললে শব্দটা চোখের সামনেই আছে।
ফাইলগুলো বিজয়ে লেখা হলে এটাই হওয়ার কথা।
কেন এমন হয়
বিজয়ে টাইপ করলে বাংলা অক্ষর জমা হয় না। জমা হয় ইংরেজি অক্ষর আর চিহ্ন, আর সুতনি এমজে (SutonnyMJ) ফন্ট সেগুলোকে বাংলা করে আঁকে। "প্রকাশিত" ফাইলের ভেতরে আসলে cÖKvwkZ। আজকের কিবোর্ডে, ফোনে বা ইউনিকোডে "প্রকাশিত" লিখে খুঁজলে সার্চ খোঁজে বাংলা অক্ষর। ফাইলে আছে ইংরেজি অক্ষর। মিল হয় না।
একই সমস্যা সব জায়গায়:
- ওয়ার্ড আর এক্সেলের Ctrl+F।
- কম্পিউটারের ফাইল সার্চ, যা ফাইলের ভেতরের লেখা খোঁজে।
- বিজয় ফাইল থেকে বানানো পিডিএফ। পিডিএফের ভেতরের লেখাও বিজয় কোডে থাকে।
- ইমেইলে পাঠানো বিজয় লেখা, বা ওয়েবসাইটে দেওয়া বিজয় নোটিশ।
আরও কঠিন: একই শব্দ, একাধিক কোড
কেউ ভাবতে পারেন, তাহলে বিজয় কোড দিয়েই খুঁজি। মাঝে মাঝে কাজ করে, কিন্তু ভরসা করা যায় না। কারণ বিজয়ে একই শব্দ কয়েক রকমভাবে জমা থাকতে পারে। "কর্তৃপক্ষ" শব্দটাই অন্তত তিন রকমভাবে থাকতে পারে:
| যেভাবে জমা আছে | কেন আলাদা |
|---|---|
KZ©…c¶ | ঋ-কারের আগে রেফ, পুরনো ক্ষ |
KZ…©cÿ | ঋ-কারের পরে রেফ, নতুন ক্ষ |
KZ©„cÿ | ঋ-কারের আগে রেফ, ঋ-কারের অন্য আকার, নতুন ক্ষ |
সুতনি এমজেতে তিনটাই হুবহু "কর্তৃপক্ষ"। কিন্তু সার্চের কাছে তিনটা আলাদা শব্দ। একটা দিয়ে খুঁজলে বাকি দুটো বাদ পড়ে। কেন এক শব্দের এত রূপ, তা বিস্তারিত এখানে: পুরনো বিজয় আর নতুন বিজয় কোড।
ইউনিকোডে এই ঝামেলা নেই। সেখানে "কর্তৃপক্ষ" একভাবেই জমা থাকে।
সাময়িক উপায়: বিজয় কোড দিয়ে খোঁজা
আজই একটা ফাইল খুঁজে বের করা দরকার হলে:
- ইউনিকোড থেকে বিজয় বক্সে শব্দটা লিখুন।
- যে বিজয় কোড আসে, সেটা কপি করুন।
- ওয়ার্ডে Ctrl+F চেপে সেই কোড দিয়ে খুঁজুন।
মনে রাখবেন, ওপরের কারণে এতে কিছু জায়গা বাদ পড়তে পারে। ছোট, সাধারণ শব্দে ভালো কাজ করে। যুক্তাক্ষর, রেফ বা ক্ষ-ওয়ালা শব্দে ফসকে যাওয়ার সম্ভাবনা বেশি।
স্থায়ী সমাধান: একবার রূপান্তর, একটা ইউনিকোড মূল কপি
বারবার কোড দিয়ে খোঁজার চেয়ে একবার বসে পুরনো ফাইলগুলো ইউনিকোডে বদলে ফেলাই ভালো।
- আসল ফাইলগুলো আলাদা ফোল্ডারে রেখে দিন। কিছুতে হাত দেবেন না। কিছু গোলমাল হলে এগুলোই ভরসা।
- ওয়ার্ড, এক্সেল, পাওয়ারপয়েন্ট ফাইল (.docx, .xlsx, .pptx) একে একে বিজয় থেকে ইউনিকোড টুলে দিন। টুল শুধু বিজয় ফন্টের লেখা ইউনিকোডে বদলায়, ইংরেজি লেখায় হাত দেয় না, আর বদলানো লেখার ফন্ট করে দেয় Nirmala UI। পুরনো .doc বা .xls হলে আগে ওয়ার্ড বা এক্সেলে খুলে .docx বা .xlsx হিসেবে সেভ করে নিন।
- পিডিএফ ফাইল টুলের পিডিএফ অংশে দিন। টুল পিডিএফের ভেতরের লেখা পড়ে, বিজয় ফন্টের লেখা ইউনিকোডে বদলায়। ফলাফল কপি করতে পারেন, বা .txt কিংবা .docx হিসেবে নামাতে পারেন। সেই .docx-টা পিডিএফের পাশেই রেখে দিন। এটাই হবে খোঁজার কপি।
- নাম দেখে যেন চেনা যায়। যেমন নামের শেষে "unicode" জুড়ে দিন:
notice-2019-unicode.docx। - মিলিয়ে দেখুন। নতুন ফাইলে Ctrl+F চেপে ইউনিকোডে একটা শব্দ লিখুন। এবার পাওয়ার কথা।
আপনার ফাইল এই ব্রাউজারেই থাকে। আমাদের সার্ভারে কিছু যায় না।
কোন ফাইল আগে বদলাবেন
সব পুরনো ফাইল এক দিনে বদলানোর দরকার নেই। যেগুলো বেশি কাজে লাগে, সেগুলো দিয়ে শুরু করুন:
- চিঠি আর নোটিশের ছক (টেমপ্লেট)। অফিসের চিঠির ছকটা বিজয়ে থাকলে প্রতিটা নতুন চিঠিও বিজয়ে জন্ম নেয়। ছকটা একবার ইউনিকোডে বদলালে সমস্যার উৎসটাই বন্ধ হয়।
- যে তালিকা বারবার খোঁজেন। কর্মচারী, শিক্ষার্থী, গ্রাহক বা সদস্যের তালিকা। এগুলোতেই সার্চ আর সর্ট সবচেয়ে বেশি লাগে।
- যে ফাইল বাইরে পাঠাতে হয়। ইমেইলে বা অনলাইনে যা যায়, তা ইউনিকোডে থাকলে প্রাপকের কম্পিউটারে সুতনি এমজে না থাকলেও ঠিক দেখায়।
- বাকি পুরনো ফাইল। এগুলো ধীরে ধীরে, যখন যেটা খোলা লাগে তখন সেটা।
এরপর থেকে নিয়ম একটাই
সংশোধন, নতুন সংস্করণ, সব কাজ হবে ইউনিকোড কপিতে। প্রেসের জন্য বিজয় লাগলে প্রতিবার সেই ইউনিকোড কপি থেকে ইউনিকোড থেকে বিজয় দিয়ে নতুন করে বানান। বিজয় কপিতে সরাসরি সংশোধন করবেন না। করলে দুটো কপি দুই রকম হয়ে যায়, আর কয়েক মাস পরে কেউ বলতে পারে না কোনটা ঠিক।
সাবধানতা ও সীমা
- স্ক্যান করা পিডিএফ। কাগজ স্ক্যান করে বানানো পিডিএফে লেখা থাকে না, থাকে শুধু ছবি। এই টুল সেখান থেকে কিছু পড়তে পারবে না। পিডিএফে কোনো শব্দ সিলেক্ট করা যায় কি না দেখে নিন। না গেলে সেটা ছবি।
- পিডিএফের সাজ নয়, লেখা। পিডিএফ থেকে যা পাবেন, তা মূলত লেখা। পাতার হুবহু সাজ আশা করবেন না। খোঁজা আর কপি করার জন্য সেটাই যথেষ্ট।
- অচেনা অক্ষর। টুল কোনো চিহ্ন চিনতে না পারলে সেটা ফেলে না দিয়ে দাগিয়ে দেখায়। দাগানো জায়গাগুলো মূল ফাইলের সাথে মিলিয়ে ঠিক করুন।
- কঠিন শব্দে চোখ বুলান। রূপান্তরের পর কয়েকটা যুক্তাক্ষরওয়ালা শব্দ দেখে নিন, বিশেষ করে সরকারি কাগজে যেগুলো বারবার আসে: কর্তৃপক্ষ, সংক্রান্ত, প্রকাশিত।
এক্সেলের তালিকায় একই সমস্যা হলে, সাজানোর (সর্ট) ঝামেলাসহ, এখানে দেখুন: এক্সেলে বিজয়ে লেখা নাম-ঠিকানা ইউনিকোডে।
যা প্রায়ই জানতে চাওয়া হয়
ওয়ার্ডে বাংলা শব্দ Ctrl+F দিয়ে খুঁজে পাই না কেন?
ফাইলটা বিজয়ে লেখা হলে ভেতরে বাংলা অক্ষর নেই, আছে ইংরেজি অক্ষর। আপনি বাংলায় লিখে খুঁজছেন, তাই মিল হচ্ছে না। ফাইলটা ইউনিকোডে রূপান্তর করলে তারপর থেকে বাংলায় লিখেই খোঁজা যাবে।
বিজয় কোড দিয়ে খুঁজলে হবে না?
কখনো হয়, কিন্তু ভরসা করা যায় না। বিজয়ে একই শব্দ কয়েক রকম কোডে জমা থাকতে পারে, যেমন “কর্তৃপক্ষ” অন্তত তিন রকম। একটা দিয়ে খুঁজলে বাকিগুলো বাদ পড়ে।
পুরনো ফাইল রূপান্তর করলে আসলটা কি বদলে যায়?
না। টুল একটা নতুন ফাইল বানিয়ে দেয়, যা আপনি ডাউনলোড করেন। আসলটা যেমন ছিল থাকে। তবু আসল ফাইলগুলো আলাদা ফোল্ডারে রেখে দেওয়াই ভালো।
বিজয় লেখা পিডিএফ কি সার্চ করার মতো বানানো যায়?
লেখাওয়ালা পিডিএফ হলে টুলের পিডিএফ অংশে দিন। বিজয় লেখা ইউনিকোডে বদলে .docx বা .txt হিসেবে পাবেন, সেটায় বাংলায় লিখে খোঁজা যায়। স্ক্যান করা পিডিএফে লেখা থাকে না, তাই সেখানে এটা কাজ করে না।
প্রেসের জন্য তো বিজয় লাগবে, তাহলে ইউনিকোড রাখব কেন?
ইউনিকোড কপিটাই মূল কপি হিসেবে রাখুন। প্রেসের দরকার হলে প্রতিবার সেখান থেকে ইউনিকোড থেকে বিজয় টুলে বিজয় কপি বানিয়ে নিন। তাতে দুটো কপি কখনো আলাদা হয়ে যায় না।