മലയാളത്തിൽ AI കോർപ്പസ് നിർമിക്കാനായി പത്തുകോടി രൂപ ഈയിടെ അവതരിപ്പിച്ച കേരളബഡ്ജറ്റിൽ നീക്കിയിരിത്തിയിട്ടുണ്ട്. ആർട്ടിഫിഷ്യൽ ഇന്റലിജൻസ് സമീപകാലത്ത് നേടിയിട്ടുള്ള വലിയ പുരോഗതിയുടെ പശ്ചാത്തലത്തിൽ മലയാളഭാഷ പുറംതള്ളാതെയിരിക്കാനായിട്ടാണ് ഈ “മലയാളം AI സംരംഭം” ബഡ്ജറ്റിൽ വിഭാവനം ചെയ്തിരിക്കുന്നത്. അത് സദുദ്ദേശപരവും കാലോചിതവുമാണ്. അതോടൊപ്പം തന്നെ ഈ പത്തുകോടികൊണ്ട് നമുക്കെന്തു ചെയ്യാനാകുമെന്നതിനെക്കുറിച്ചുള്ള കുറച്ചുചിന്തകൾ കൂടി പങ്കുവെക്കട്ടെ.

എന്താണ് ഒരു കോർപ്പസ്?
AI മോഡലുകളുടെ പരിശീലനത്തിന് അതിവിപുലമായ ഉള്ളടക്കം ആവശ്യമാണ്. ഇത് ടെക്സ്റ്റ് ആവാം, ചിത്രങ്ങളാവാം, സംഭാഷണങ്ങളുടെ റെക്കോർഡിങ്ങ് ആവാം. ഇതിനെയാണ് ട്രെയിനിങ്ങ് കോർപ്പസ്സ് എന്ന് വിളിക്കുന്നത്. എത്രത്തോളം വലുതാണ് കോർപ്പസ് അത്രത്തോളം ഈ മോഡലുകൾ മെച്ചമായിരിക്കുമെന്നാണ് നിലവിലെ ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ സാങ്കേതികവിദ്യ. അതിനായി, ഇത്തരം മോഡലുകളുടെ നിർമാതാക്കളും ഗവേഷകരും ഇന്റർനെറ്റിൽ നിന്ന് കിട്ടാവുന്ന എല്ലാ ഡാറ്റയും ഉപയോഗിക്കാൻ ശ്രമിക്കുകയാണ്. ഈ മത്സരത്തിൽ പകർപ്പവകാശവും ഉള്ളടക്കത്തിന്റെ ഉടമസ്ഥാവകാശവുമൊക്കെ പലവട്ടം കോടതി കേറിയിറങ്ങിയെങ്കിലും വലിയവിജയമൊന്നും നേടിയിട്ടില്ല.
ഒരു വർഷത്തിൽ 50 പുസ്തകം വായിക്കുന്ന ഒരാൾ എൺപത് വയസ്സാകുമ്പോഴേക്കും ഏകദേശം നാലായിരം പുസ്തകങ്ങൾ വായിച്ചേക്കാം. ഈ വായനക്കാരൻ മുന്നൂറ് ദശലക്ഷം വർഷം ഇങ്ങനെ വായിച്ചാൽ ഒരു ലാർജ് ലാംഗ്വേജ് മോഡലിന്റെ ട്രെയിനിങ്ങ് ഡാറ്റയുടെയത്രയും വരും. LLM ന്റെ കണക്കിൽ 15 ട്രില്യൻ ടോക്കണൂകൾ. ഇത് GPT-5 എന്ന ഓപ്പൺ എഐയുടെ ട്രെയിനിങ്ങ് ഡാറ്റയുടെ വലിപ്പമാണ്. ഇന്റർനെറ്റിൽ നിന്ന് കിട്ടാവുന്നതെല്ലാം ഇതിലുണ്ട്. എല്ലാ വിക്കിപീഡിയ ലേഖനങ്ങളും ഡിജിറ്റൈസ് ചെയ്ത എല്ലാ പുസ്തകങ്ങളും കോടിക്കണക്കിന് സോഫ്റ്റ്വെയർ പ്രോഗ്രാമുകളും, ഗവേഷണപ്രബന്ധങ്ങളും, സോഷ്യൽമീഡിയ ഉള്ളടക്കവും.
അതെല്ലാം ഭൂരിപക്ഷവും ഇംഗ്ലീഷാണെന്ന് മാത്രം. മലയാളം അതിന്റെ 0.00165 ശതമാനമാണെന്ന് OpenAI യുടെ GPT-3 മോഡലിന്റെ ടെക്നിക്കൽ റിപ്പോർട്ടിൽ പറഞ്ഞിട്ടുണ്ട്. 93% ഇംഗ്ലീഷും.To know the percentage of language training data in GPT-3, refer this spreadsheet
കോർപ്പസിലുള്ള ഉള്ളടക്കം എങ്ങനെയുള്ളതാണ്?
കോർപ്പസിലുള്ള ഉള്ളടക്കം എങ്ങനെയുള്ളതാണ്? അതിന് പ്രത്യേകിച്ച് യാതൊരു ഘടനയോ അച്ചടക്കമോയില്ല. ഇന്റർനെറ്റിൽ നിന്ന് വലിച്ച് വാരിയെടുക്കുന്ന എന്തും അതേപടി. അതിലില്ലാത്ത പുതിയത് വല്ലതും ആരെങ്കിലും പ്രസിദ്ധീകരിക്കുന്നുണ്ടോയെന്ന് LLM കമ്പനികൾ ദിനം പ്രതി വെബ്സൈറ്റുകളിൽ പരതുകയാണ്.The AI Scraping War: LLM Crawlers Are Breaking the Web AI crawlers now consume more bandwidth than humans on many sites. The arms race between publishers and LLM companies is reshaping the open web. ഇത്രയും വലിയ ഉള്ളടക്കം ആരും സംശോധനം ചെയ്യുന്നില്ല. അത് അസാധ്യവുമാണ്. എന്തായിരിക്കും മലയാളം ഉള്ളടക്കത്തിന്റെ സ്വഭാവം. നമ്മുടെ ഡിജിറ്റൽ മലയാളം പൊതുവിൽ വാർത്തകളും ബ്ലോഗുകളും സോഷ്യൽ മീഡിയയുമാണ്. അതിൽ വാർത്തക്കും വിനോദത്തിനുമാണ് മുൻതൂക്കം. ശാസ്ത്രവിഷയങ്ങളൊന്നും വലിയരീതിയിൽ മലയാളം ഇന്റർനെറ്റിലില്ല. അശ്ലീലവും മതപരമായലേഖനങ്ങളും വളരെയുണ്ടുതാനും. garbage-in, garbage-out എന്ന കഴിച്ചത് മാത്രം ശർദ്ദിക്കാനാവുന്ന ഈ മോഡലുകളെ പലരീതിയിൽ മെരുക്കിയെടുത്തിട്ടാണ് ഇന്നത്തെ രീതിയിൽ ഉപയോഗ്യയോഗ്യമാക്കിത്തീർത്തിരിക്കുന്നത്. അതുനടന്നതാകട്ടെ, ഈ കോർപ്പസിൽ ഉപകാരമുള്ള ഉള്ളടക്കത്തിന് മുൻതൂക്കം കൊടുക്കാൻ ഇംഗ്ലീഷ് പോലെയുള്ള ഭാഷകൾക്ക് കഴിഞ്ഞതുകൊണ്ടുമാത്രമാണ്.
ഈയൊരവസ്ഥ മാറണമെങ്കിൽ മലയാളത്തിനും നല്ല കോർപ്പസ് വേണം. ഇതായിരിക്കണം ബഡ്ജറ്റിലെ നിർദ്ദേശത്തിന്റെ പശ്ചാത്തലവുംThe last budget by LDF government in Jan 2027 had allocated 1 crore rupees for developing a Malayalam Language Model- Bullet number 147.. നമ്മൾ ചിന്തിക്കേണ്ടത് ഭാഷകൾക്ക് കോർപ്പസ് എങ്ങനെയുണ്ടാകുന്നുവെന്നതാണ്. ഇംഗ്ലീഷ് പോലെയുള്ള ഭാഷകൾക്ക് കോർപ്പസ് വന്നത് ആ ഭാഷയുടെ ഇന്റർനെറ്റിലെ ജൈവികമായ വളർച്ചയും സാന്നിദ്ധ്യവും കൊണ്ടാണ് ഇന്റർനെറ്റിന്റെയും കംപ്യൂട്ടറുകളുടെയും തുടക്കം മുതൽ ഇംഗ്ലിഷിലാണ്. മലയാളം കമ്പ്യൂട്ടറുകളിലും ഇന്റർനെറ്റിലും വന്നിട്ട് ഏകദേശം 25 വർഷമാകുന്നു. . മലയാളത്തിന് അത് കുറവായതിനാൽ നമ്മൾ നേരിട്ട് കോർപ്പസ് നിർമിക്കണമെന്ന് തോന്നുന്നത് സ്വാഭാവികം. പക്ഷേ ഈ കോർപ്പസ് അടിച്ചുകൂട്ടി വാരിയെടുത്ത ഉള്ളടക്കം മാത്രമാണ്. മോഡലുകളുടെ ട്രെയിനിങ്ങ് മാത്രമാണ് അതിന്റെ ലക്ഷ്യം. അതിൽ സംശോധനമില്ല. അടുക്കിപ്പെറുക്കിവെക്കലില്ല. പുതുക്കലുകളില്ല. വളരെ സങ്കുചിതമായ ഉപയോഗം മാത്രം. ആർക്കാണ് ഉപകാരപ്പെടുന്നത്? ഇത്തരം മോഡലുകൾ ട്രെയിൻ ചെയ്യാൻ കമ്പ്യൂട്ടിങ്ങ് ശേഷിയുള്ള വലിയ സ്ഥാപനങ്ങൾക്കുമാത്രം. ആ മോഡലുകൾ തിരിച്ച് സമൂഹത്തിന് വിൽക്കുകയും ചെയ്യും. പക്ഷേ അങ്ങനെ ചെയ്യരുതെന്ന് പറയാനോ തെറ്റാണെന്ന് തർക്കിക്കാനോ ഞാനില്ല. പകരം വേറൊരു മാതൃക എനിക്ക് ചൂണ്ടിക്കാണിക്കാനുണ്ട്.
ഡിജിറ്റൈസേഷനോ കോർപ്പസോ
അത് ഡിജിറ്റൈസേഷനിൽക്കൂടിയുള്ള ഭാഷാശാക്തീകരണമാണ്. ഡിജിറ്റലി ലഭ്യമായ ഭാഷയിലെ ഉള്ളടക്കത്തിന്റെ ഒരു ഉപഗണമാണ് കോർപ്പസ്. ഇന്നത്തെ അവസ്ഥയിൽ ഏകദേശം പൊതു ഉടമസ്ഥതയിലുള്ളപോലെ വിവിധകമ്പനികൾ അനുവാദമില്ലാതെ എടുത്തുകൊണ്ടുപോകുന്നത്. ഭാഷയിലെ വിജ്ഞാനസ്രോതസ്സുകൾ ഡിജിറ്റലാക്കി പുഷ്ടിപ്പെടുത്തത് ദീർഘകാലാടിസ്ഥാനത്തിലുള്ള ഭാഷാസൂത്രണമാണ്. വിവിധ മേഖലകളിലെ അറിവിനെ ഡിജിറ്റലാക്കുമ്പോൾ അത് എല്ലാതരത്തിലുള്ള വിദ്യാഭ്യാസപദ്ധതികൾക്കും മുതൽക്കൂട്ടാകുന്നു. അച്ചടിച്ച പാഠപുസ്തകത്തിൽ നിന്ന് വളരെ ഉയരെ. കേരളത്തിന് പുറത്ത് വ്യാപിച്ച് കിടക്കുന്ന മലയാളികൾക്കെല്ലാം വിരൽത്തുമ്പിലെത്തുന്ന മലയാളം. സാഹിത്യം ശാസ്ത്രം ചരിത്രം എല്ലാം പുസ്തകങ്ങളിൽന്ന് ഡിജിറ്റൈസ് ചെയ്ത് എല്ലാവർക്കും തിരഞ്ഞാൽ കിട്ടുന്ന രീതിയിലെത്തണം. അതിന് മുകളിൽ അറിവ് പടുത്തുയർത്താനാകണം.
ഡിജിറ്റൈസേഷൻ എന്നാൽ അച്ചടിച്ചതിന്റെ ഫോട്ടോയെടുത്ത് ചിത്രമോ പിഡിഎഫ് ആക്കലോ ആണെന്ന് ചിലരെങ്കിലും തെറ്റിദ്ധരിച്ചിടുണ്ട്. അത് ഒരു തുടക്കം മാത്രം. യുണിക്കോഡിൽ ഉള്ള ടെക്സ്റ്റായി അടുക്കിയൊതുക്കിStructured data refers to highly organized, machine-readable information that is formatted using consistent, searchable models rather than plain text. In the context of the web, it bridges the gap between human-readable content and computer understanding സംരക്ഷിക്കുമ്പോഴാണ് ഡിജിറ്റൈസേഷൻ അർത്ഥവത്താകുന്നത്.
ഒപ്പം നിഘണ്ടുക്കളും മറ്റ് ഡാറ്റാസെറ്റുകളും ജനങ്ങൾക്കായി തയ്യാറാക്കി തുറന്നിടണം. സ്വാഭാവികമായും ഡിജിറ്റൈസേഷന്റെ കൂടെ വരുന്നതാണ് ഈ ഡിജിറ്റൽ ഉള്ളടക്കത്തിന്റെ കമ്പ്യൂട്ടർ പ്രൊസസ്സിങ്ങിനുള്ള സോഫ്റ്റ്വെയർ. ഭാഷാകമ്പ്യൂട്ടിങ്ങ് ഡിജിറ്റൈസേഷന്റെ അനുബന്ധമായി വളർത്തണം. പഠിപ്പിക്കണം, പരിശിലീപ്പിക്കണം. ഇംഗ്ലീഷിനെക്കാൾ പലരീതിയിൽ സങ്കീർണമാണ് നമ്മുടെ ഭാഷ. വാക്കുകൾ പലരീതിയിൽ കൂടിച്ചേരുന്ന, എത്രവേണമെങ്കിലും വാക്കുകൾ വിളക്കിചേർക്കാവുന്ന ഭാഷയാണ് നമ്മുടേത്. LLM-കളുടെ, അടുത്ത വാക്ക് പ്രവചിക്കുന്ന ഭാഷാസാങ്കേതികവിദ്യനിർമിതബുദ്ധി ഭാഷ പഠിക്കുന്നതെങ്ങനെ?, വാക്കുകളുടെ ക്രമത്തിന് നിഷ്ഠയുള്ള ഇംഗ്ലീഷിൽ നിന്നും ക്രമനിഷ്ഠ ഇല്ലാത്ത മലയാളത്തിൽ അതേപോലെത്തന്നെ പ്രവർത്തിക്കില്ല എന്ന് യാഥാർത്ഥ്യവും നമ്മൾ അംഗീകരിക്കണം.The Broken Token: Tokenization for Malayalam Language Models. അങ്ങനെവരുമ്പോൾ ഇംഗ്ലീഷ് സാങ്കേതികവിദ്യ അതേപടി മലയാളത്തിൽ ഇറക്കുമതി ചെയ്യാതെ മലയാളഭാഷാസാങ്കേതികവിദ്യ വികസിപ്പിക്കാനുള്ള കെല്പും നമ്മൾ നേടിയേത്തീരൂ.
പ്രാഥമികമായും ജനങ്ങൾക്ക് വേണ്ടി ഡിജിറ്റൈസ് ചെയ്യണം. അത് സ്വാഭാവികമായും കോർപ്പസുകളുടെ ഭാഗമായിക്കോളും. കോർപ്പസിനേക്കാൾ വലുതായി ഡിജിറ്റൈസേഷനിലൂടെയുള്ള ഭാഷാസൂത്രണത്തെ കാണുമ്പോളാണ് പത്തുകോടി നമ്മൾ നല്ലരീതിയിൽ ഉപയോഗിക്കുന്നത്.
ഇത്തരം ഡിജിറ്റൈസേഷൻ ആസൂത്രണം ചെയ്യുമ്പോൾ മനസ്സിലാകുന്ന ഒരു കാര്യം കോർപ്പസ് നിർമാണത്തിന് ചുമതലയുള്ള ഒരു സ്ഥാപനത്തിന് പകരം സമൂഹത്തിന്റെ പലഭാഗത്തുനിന്നുള്ളവരുടെ പ്രവർത്തനവും അതിന്റെ ഏകീകരണവും ആവശ്യമായിവരുമെന്നതാണ്. ഗവൺമെന്റ് രേഖകൾ ഡിജിറ്റൈസ് ചെയ്തു പ്രസിദ്ധീകരിക്കാൻ ഗവൺമെന്റ് ശ്രദ്ധിക്കണം. ഉദാഹരണത്തിന്, സംസ്ഥാന ബഡ്ജറ്റിന്റെ പിഡിഎഫ് രേഖ വെബ് സൈറ്റിലിടുന്നത് ഡിജിറ്റൈസേഷന്റെ നല്ല ഉദാഹരണമല്ല. അത് ഒരു വെബ് പേജായി സെർച് ചെയ്യാവുന്ന, ഹൈപ്പർലിങ്കുകൾ ഉപയോഗിക്കുന്ന രേഖയാക്കുന്നതാണ് ഡിജിറ്റൈസേഷന്റെ ലക്ഷ്യം. സർവകലാശാലകളിലെ ഗവേഷണപ്രബന്ധങ്ങൾ പിഡിഎഫ് ആയി പ്രസിദ്ധീകരിക്കുന്നതിനുപകരം വെബ് പേജുകളായി ചിത്രങ്ങളും വീഡിയോയും അനിമേഷനും ഉൾപ്പെടുത്താവുന്ന ആധുനിക വെബ് ഉള്ളടക്കമായി വരട്ടെ. അങ്ങനെ പ്രസിദ്ധീകരിച്ചതിന്റെ മണിക്കൂറുകൾക്കുള്ളിൽ അവ ചാറ്റ് ജിപിടിപോലെയുള്ള സംവിധാനങ്ങളിൽ എത്തുന്നതുകാണാം.
മൂന്നരലക്ഷം ആൾക്കാർ സംസാരിക്കുന്ന ഐസ്ലാൻഡിക് ഭാഷക്കാർ 2019ൽ നാഷണൽ ലാംഗ്വേജ് ടെക്നോളജി പ്രോഗ്രാം ആവിഷ്കരിച്ചിരുന്നു. ഭാഷയുടെ “ഡിജിറ്റൽ മരണം”(Digital Extinction) തടയാനുള്ള ദശലക്ഷക്കണക്കിന് പണം മുടക്കിയ ആ പദ്ധതിയിൽ കോർപ്പസ് ഉണ്ടാക്കുന്നതിന് പകരം അവർ ഭാഷാസൂത്രണത്തിൽ ശ്രദ്ധയൂന്നി. ഡിജിറ്റൈസേഷൻ, ഡാറ്റാസെറ്റുകൾ, ഭാഷാ കമ്പ്യൂട്ടിങ്ങ് സോഫ്റ്റ്വെയർ വികസിപ്പിക്കൽ, പരിശീലനം തുടങ്ങിയ അഞ്ച് വർഷത്തെ പദ്ധതിയുണ്ടാക്കി. ഈ പദ്ധതികൾ നടത്താൻ മൈക്രോസോഫ്റ്റ് പോലെയുള്ള കമ്പനികളുടെ ഫണ്ട് മേടിച്ചു. ഇതെല്ലാം സ്വതന്ത്ര ലൈസൻസിൽ പ്രസിദ്ധീകരിക്കുകയും ചെയ്തു. മൂന്നരക്കോടിയുള്ള മലയാളികൾക്കും ഈ മാതൃക എന്തുകൊണ്ടു തുടർന്നുകൂടാ?