വായിക്കാൻ 3 മിനിറ്റ്

ഒരു വാചകം എഴുതിയാൽ ചലിക്കുന്ന വീഡിയോ: കമ്പ്യൂട്ടർ ഭൗതിക ലോകം പഠിക്കുന്നത് എങ്ങനെ?

പ്രസിദ്ധീകരിച്ചത്

30 സെക്കൻഡിൽ സാരം

ഓപ്പൺഎഐ വീഡിയോ മോഡലുകൾ എന്നത് ഒരു വാചക വിവരണത്തിൽ നിന്നോ നിശ്ചല ചിത്രത്തിൽ നിന്നോ പുതിയ ചലിക്കുന്ന വീഡിയോ നിർമ്മിക്കുന്ന കമ്പ്യൂട്ടർ സംവിധാനങ്ങളാണ്. ലക്ഷക്കണക്കിന് വീഡിയോ ദൃശ്യങ്ങൾ പഠിച്ച്, വസ്തുക്കളുടെ ചലനവും പ്രകാശവും തമ്മിലുള്ള ബന്ധം മനസ്സിലാക്കിയാണ് ഇവ പ്രവർത്തിക്കുന്നത്. ഫലമായി ലഭിക്കുന്നത് യഥാർത്ഥത്തിൽ എടുത്തതല്ലാത്ത, എന്നാൽ യഥാർത്ഥമെന്ന് തോന്നിക്കുന്ന ദൃശ്യങ്ങളാണ്.

OpenAI Sorasora.com ↗
ഓപ്പൺഎഐയുടെ ഔദ്യോഗിക വീഡിയോ നിർമ്മാണ ഉപകരണം. ChatGPT Plus, Pro വരിക്കാർക്ക് sora.com വഴി ലഭ്യമാണ്.

ഒരു ചെറിയ കഥ പറയാൻ ഒരു വീഡിയോ വേണം. ക്യാമറയോ ഷൂട്ടിംഗ് സംഘമോ ഇല്ല. ഒരു വാചകം എഴുതി 'ജനറേറ്റ്' അമർത്തിയാൽ കുറച്ച് നിമിഷങ്ങൾക്കകം ചലിക്കുന്ന ദൃശ്യം വന്നു നിറയുന്നു. ഇത് മാജിക് അല്ല. കമ്പ്യൂട്ടർ ലോകത്തെ ചലനങ്ങൾ എങ്ങനെയാണ് എന്ന് പഠിച്ചെടുക്കുന്ന ഒരു സംവിധാനമാണ്. ആ പഠനത്തിന്റെ രീതി മനസ്സിലാക്കിയാൽ, ഈ വീഡിയോകളിലെ പിഴവുകളും നമുക്ക് തിരിച്ചറിയാം.

ചിത്രങ്ങളുടെ കഷണങ്ങളിൽ നിന്ന് ചലനം പഠിക്കുന്നു

ഒരു ഫോട്ടോ നോക്കുമ്പോൾ നമ്മൾ ഒരു കാഴ്ച കാണുന്നു. എന്നാൽ കമ്പ്യൂട്ടറിന് അത് വരികളും നിറങ്ങളും കൊണ്ടുള്ള സംഖ്യകളുടെ കൂട്ടമാണ്. ഈ സംഖ്യകളെ ചെറിയ ചതുരങ്ങളായി മുറിച്ച്, ഓരോ ചതുരത്തിലും എന്താണുള്ളതെന്ന് പഠിക്കുന്ന രീതിയുണ്ട്. ഇതിനെ ചിത്രത്തിന്റെ ചെറിയ കഷണങ്ങൾ (പാച്ചുകൾ) എന്ന് വിളിക്കാം. ഒരു വീഡിയോയിൽ ഈ കഷണങ്ങൾക്ക് കാലവും കൂടി ചേരുന്നു. അതായത്, ഒരു കഷണം അടുത്ത നിമിഷത്തിൽ എവിടെയായിരിക്കും എന്നതും കമ്പ്യൂട്ടർ പഠിക്കുന്നു.

ഇവിടെയാണ് ഭൗതിക ലോകത്തിന്റെ അനുകരണം തുടങ്ങുന്നത്. ഒരു പന്ത് മുകളിലേക്ക് എറിഞ്ഞാൽ അത് താഴേക്ക് വീഴുന്നു. ഒരു വ്യക്തി നടക്കുമ്പോൾ കാലുകൾ എങ്ങനെ ചലിക്കുന്നു. വെളിച്ചം ഒരു വസ്തുവിൽ തട്ടുമ്പോൾ നിഴൽ എവിടെ വീഴുന്നു. ഇതെല്ലാം ലക്ഷക്കണക്കിന് വീഡിയോകളിൽ നിന്ന് കമ്പ്യൂട്ടർ ശ്രദ്ധിച്ച് പഠിക്കുന്നു. ഈ പഠനത്തെ ഡിഫ്യൂഷൻ ട്രാൻസ്ഫോർമർ (Diffusion Transformer) എന്ന സാങ്കേതിക രീതിയിലൂടെയാണ് സാധ്യമാക്കുന്നത്. ഇത് ഒരു റെഡിമെയ്ഡ് വീഡിയോ കൂട്ടിച്ചേർക്കുന്നതല്ല. പകരം, ക്രമരഹിതമായ കുത്തുകളിൽ നിന്ന് തുടങ്ങി, നൽകിയ വിവരണത്തിനനുസരിച്ച് ആ കുത്തുകളെ ഘട്ടം ഘട്ടമായി ക്രമീകരിച്ച് വ്യക്തമായ ദൃശ്യം രൂപപ്പെടുത്തുകയാണ് ചെയ്യുന്നത്.

വാചകം കമ്പ്യൂട്ടറിന് മനസ്സിലാകുന്നത് എങ്ങനെ?

നിങ്ങൾ എഴുതുന്ന വാചകം കമ്പ്യൂട്ടർ വായിക്കുന്നു. 'ഒരു പൂച്ച ജനലിനരികിൽ ഇരിക്കുന്നു, വൈകുന്നേരത്തെ വെളിച്ചം' എന്ന് എഴുതിയാൽ, അതിലെ ഓരോ വാക്കും എന്തിനെ സൂചിപ്പിക്കുന്നു എന്ന് അത് തിരിച്ചറിയുന്നു. പൂച്ച, ജനൽ, വെളിച്ചം, ഇരിക്കൽ എന്നിവയെല്ലാം അതിന്റെ പഠിത്തത്തിൽ നിന്ന് പരസ്പരം ബന്ധപ്പെടുത്തുന്നു. ഈ ബന്ധം വച്ചാണ് ഓരോ ഫ്രെയിമിലും എന്ത് വരയ്ക്കണം എന്ന് അത് തീരുമാനിക്കുന്നത്. അതുകൊണ്ടാണ് ഒരേ വാചകം എഴുതുമ്പോൾ ഓരോ തവണയും അല്പം വ്യത്യസ്തമായ വീഡിയോ വരുന്നത്. ഇത് ഒരു കൃത്യമായ കോപ്പി അല്ല, ഓരോ തവണയും പുതിയ ഒരു സൃഷ്ടിയാണ്.

ഈ സംവിധാനത്തിന്റെ ഏറ്റവും ശ്രദ്ധേയമായ കഴിവ്, ഒരു കഥാപാത്രം സ്ക്രീനിൽ നിന്ന് പോയി വീണ്ടും വന്നാലും അതിന്റെ രൂപവും വസ്ത്രവും മാറാതെ നിൽക്കുന്നു എന്നതാണ്. ഇതിനെ വസ്തു സ്ഥിരത (Object Persistence) എന്ന് പറയാം. കൂടാതെ, ക്യാമറയുടെ ചലനങ്ങളും നിയന്ത്രിക്കാം. ഒരു ഡ്രോൺ പറക്കുന്നതുപോലെ, അല്ലെങ്കിൽ ഒരു ക്രെയിൻ ഉയർത്തുന്നതുപോലെ, ദൃശ്യത്തിന്റെ കോണും വേഗതയും മാറ്റാൻ സാധിക്കും. ഇത് സാധാരണ ക്യാമറയിൽ ചെയ്യാൻ പ്രയാസമുള്ള കാര്യങ്ങളാണ്.

എവിടെയാണ് ഇത് പിഴയ്ക്കുന്നത്?

എല്ലാ കാര്യങ്ങളും കമ്പ്യൂട്ടർ കൃത്യമായി പഠിച്ചിട്ടില്ല. ചിലപ്പോൾ ഒരു വ്യക്തി പിന്നോട്ട് നടക്കുന്നത് അൽപം വിചിത്രമായി തോന്നാം. അല്ലെങ്കിൽ ഒരു ഗ്ലാസ് തറയിൽ വീഴുന്നതിന് മുമ്പേ അത് പൊട്ടുന്നതായി കാണാം. ഇത് കമ്പ്യൂട്ടറിന്റെ വിഡ്ഢിത്തമല്ല. ഭൗതിക നിയമങ്ങൾ പൂർണ്ണമായി പഠിക്കാൻ അതിന് കഴിഞ്ഞിട്ടില്ല എന്നതിന്റെ അടയാളമാണ്. ഇത്തരം ചെറിയ പിഴവുകൾ നോക്കിയാൽ, ഒരു വീഡിയോ യഥാർത്ഥത്തിൽ എടുത്തതാണോ അതോ കമ്പ്യൂട്ടർ നിർമ്മിച്ചതാണോ എന്ന് സൂചന ലഭിക്കും. എന്നാൽ ഇത് ഒരു ഉറപ്പായ മാർഗ്ഗമല്ല. നല്ല ഗുണനിലവാരമുള്ള വീഡിയോകളിൽ ഈ പിഴവുകൾ കാണണമെന്നില്ല.

ഈ വീഡിയോകൾ പങ്കുവയ്ക്കുമ്പോൾ അവയിൽ ഉറവിട വിവരങ്ങൾ (C2PA മെറ്റാഡാറ്റ) ചേർക്കുന്നുണ്ട്. അതായത്, ഇത് കമ്പ്യൂട്ടർ നിർമ്മിച്ചതാണ് എന്ന് സൂചിപ്പിക്കുന്ന ഒരു രേഖ. കൂടാതെ, കണ്ണിന് കാണാവുന്നതും അല്ലാത്തതുമായ വെള്ളപ്പൊട്ടുകളും (വാട്ടർമാർക്കുകൾ) ഉണ്ടാകും. എന്നാൽ ഇത് എല്ലായ്പ്പോഴും പൂർണ്ണമായ സുരക്ഷ ഉറപ്പുനൽകുന്നില്ല. ഒരു വീഡിയോ കണ്ടാൽ അത് ശരിയാണെന്ന് വിശ്വസിക്കുന്നതിന് മുമ്പ്, അതിന്റെ ഉറവിടം മറ്റ് വഴികളിൽ പരിശോധിക്കുന്നത് നല്ലതാണ്.

ഇത് എന്തിനാണ് ഉപയോഗിക്കുന്നത്?

  • ചെറിയ പരസ്യങ്ങൾക്കും സോഷ്യൽ മീഡിയ ഉള്ളടക്കത്തിനും വേഗത്തിൽ ദൃശ്യങ്ങൾ തയ്യാറാക്കാൻ.
  • കഥകൾ പറയാനും ആശയങ്ങൾ കാണിച്ചുകൊടുക്കാനും ഒരു ഡ്രാഫ്റ്റ് വീഡിയോ ഉണ്ടാക്കാൻ.
  • പഠനത്തിനും അധ്യാപനത്തിനും ചരിത്ര സംഭവങ്ങളോ ശാസ്ത്ര പ്രക്രിയകളോ ദൃശ്യവൽക്കരിക്കാൻ.
  • സിനിമയിലും ആനിമേഷനിലും ആദ്യ രൂപരേഖ (Storyboard) തയ്യാറാക്കാൻ.

ഈ സാങ്കേതികവിദ്യ ഉപയോഗിക്കുമ്പോൾ ഒരു കാര്യം ഓർക്കണം. ഇത് ഒരു ഉപകരണം മാത്രമാണ്. ഇത് നിർമ്മിക്കുന്ന ദൃശ്യങ്ങൾ യഥാർത്ഥത്തിൽ സംഭവിച്ചതല്ല. അതുകൊണ്ട്, ഒരു വീഡിയോ കണ്ട് അത് സത്യമാണെന്ന് തീരുമാനിക്കുന്നതിന് മുമ്പ്, അതിന്റെ ഉറവിടം, തീയതി, സന്ദർഭം എന്നിവ പരിശോധിക്കുന്നത് പ്രധാനമാണ്. കമ്പ്യൂട്ടർ നിർമ്മിച്ച ദൃശ്യങ്ങൾ തിരിച്ചറിയാനുള്ള കഴിവ് ഇന്ന് ഒരു അടിസ്ഥാന വൈദഗ്ധ്യമായി മാറിയിരിക്കുന്നു.

ഉറവിടങ്ങൾ
  1. വീഡിയോ നിർമ്മാണ മോഡലുകൾ ലോക അനുകരണ യന്ത്രങ്ങളായിOpenAI