Roblox ஸ்டுடியோவிற்கான செயல்திறன்மிக்க AI உதவியாளர்களுக்கு OpenGameEval-ஐப் பயன்படுத்தி அளவீடு செய்தல்
AI உதவியாளர் செயல்திறனை மதிப்பிடுவதற்கான முதல் ராப்லாக்ஸ் ஸ்டுடியோவிற்கான சொந்த மதிப்பீட்டு கட்டமைப்பு மற்றும் அளவீட்டுத் தரநிலை

சவால்
உருவாக்குபவர்கள் ரோப்லாக்ஸ் அனுபவ மேம்பாட்டை விரைவுபடுத்த ரோப்லாக்ஸ் ஸ்டுடியோவின் AI உதவியாளரைப் பயன்படுத்துகின்றனர், ஆனால் ஊடாடும் மேம்பாட்டுப் பணிகளில் AI உதவியாளரும் அதன் அடிப்படையிலான பெரிய மொழி மாதிரிகளும் (LLMs) எவ்வளவு சிறப்பாகச் செயல்படுகின்றன என்பதை மதிப்பிடுவது ஒரு சவாலாகவே உள்ளது. பாரம்பரிய கோடிங் மற்றும் முகவர் சார்ந்த அளவுகோல்கள் தனிமைப்படுத்தப்பட்ட, நிலை இல்லாத பணிகளில் கவனம் செலுத்தும் அதே வேளையில், ராப்லாக்ஸ் மேம்பாட்டுப் பணிப்பாய்வுகள் 3D படிநிலைகளில் பகுத்தறிதல், பல பயனர் வாடிக்கையாளர்-சர்வர் இடைவினைகளை நிர்வகித்தல், மற்றும் ஒரு நிலை கொண்ட உலகில் மாற்றங்களைச் செய்தல் போன்ற பணிகளில் செயல்திறனை அளவிடும் நோக்கத்திற்காக உருவாக்கப்பட்ட மதிப்பீட்டு முறைகளைக் கோருகின்றன.
இந்த சவாலைச் சமாளிக்க, நாங்கள் OpenGameEval-ஐ அறிமுகப்படுத்துகிறோம். இது, மீண்டும் உருவாக்கக்கூடிய Roblox ஸ்டுடியோ சூழலில் LLM-அடிப்படையிலான AI உதவியாளர் செயல்திறனை மதிப்பிடும் ஒரு திறந்த மூல மதிப்பீட்டு கட்டமைப்பு மற்றும் உள்ளார்ந்த தரநிலையிடும் தரவுத்தொகுப்பாகும். OpenGameEval மற்றும் அதன் பொதுவான லீடர்போர்டு, கருவி பயன்பாடு, முகவரியான பகுத்தறிவு, மற்றும் நீண்ட காலப் பணிகளைத் தீர்ப்பது தொடர்பான முக்கிய மாதிரித் திறன்களை மதிப்பிடுவதற்கு, பரந்த AI ஆராய்ச்சி சமூகத்திற்கு ஒரு தனித்துவமான சோதனைத் தளத்தை வழங்கும் என்று நாங்கள் நம்புகிறோம்.

தீர்வு
ஓப்பன் கேம்எவால் மதிப்பீட்டு கட்டமைப்பு, ராப்லாக்ஸ் மேம்பாட்டுச் சூழலைப் பிரதிபலிக்கும் வகையில் வடிவமைக்கப்பட்டுள்ளது. ஒவ்வொரு மதிப்பீடும் ராப்லாக்ஸ் ஸ்டுடியோவில் எடிட் மற்றும் ப்ளே டைம் நடத்தைகளை உருவகப்படுத்தும் ஒரு சூழலில் இயக்கப்படுகிறது. இது இயற்பியல், நெட்வொர்க்கிங் மற்றும் மல்டிபிளேயர் தொடர்பு போன்ற கவனிக்கப்பட்ட நடத்தைகள், ஒரு உருவாக்குநரோ அல்லது வீரரோ அனுபவிப்பதற்குச் சமமாக இருப்பதை உறுதி செய்கிறது.
இந்த கட்டமைப்பு உள்ளீட்டு உருவகப்படுத்துதலை உள்ளடக்கியுள்ளது, இது பயனர் செயல்களை (எ.கா., பொத்தான் கிளிக் செய்தல், விசைப்பலகை உள்ளீடுகள் மற்றும் கேமரா கையாளுதல்) தேவைப்படும் மேம்பாட்டுப் பணிகளை மதிப்பிடுவதற்குத் தேவையான சிக்கலான வீரர் இடைவினைகளை நிரல்முறையாகப் பிரதிபலிக்க எங்களை அனுமதிக்கிறது.
முழுமையான மதிப்பீட்டு கட்டமைப்பு, ஒரு ஒருங்கிணைந்த, பயன்படுத்த எளிதான API-க்குப் பின்னால் உள்ளடக்கப்பட்டுள்ளது. இந்த அருவமாக்கல், ஆராய்ச்சி கூட்டாளர்கள் அடிப்படைச் சூழல் கருவிகளை மாற்றியமைக்காமல், ஒரே மாதிரியான அளவீட்டுப் பணிகளைச் செய்யும் பல்வேறு LLM-அடிப்படையிலான முகவர் அமைப்புகளை அளவீடு செய்ய அனுமதிக்கிறது.

ஓப்பன் கேம்எவால் பெஞ்ச்மார்க் தரவுத்தொகுப்பு
ஓப்பன் கேம்எவால் பெஞ்ச்மார்க் தரவுத்தொகுப்பு என்பது, ஒரு கடுமையான, மீண்டும் மீண்டும் செய்யப்படும், மற்றும் முழுமையாக மனிதனால் சரிபார்க்கப்பட்ட செயல்முறையின் மூலம் இந்த கட்டமைப்பின் மீது உருவாக்கப்பட்ட, 47 சோதனை நிகழ்வுகளின் திறந்த மூல, கைமுறையாகத் தொகுக்கப்பட்ட ஒரு தொகுப்பாகும். நாங்கள் துறை வல்லுநர்களிடமிருந்து உந்துதல்களைச் சேகரித்து, AI மாதிரிகளுக்குத் தேவையான சூழலை வழங்குவதற்காக பிரத்யேக ரோப்லாக்ஸ் அனுபவச் சூழல்களை உருவாக்கி, கைமுறையாக மதிப்பீடுகளையும் அதிகாரப்பூர்வ தீர்வுகளையும் உருவாக்கி, முழுமை, பொதுமைப்படுத்தக்கூடிய தன்மை மற்றும் நிலைத்தன்மை ஆகியவற்றை உறுதி செய்வதற்காக அனைத்துச் சூழ்நிலைகளையும் விரிவான மனித மறுஆய்வுக்கு உட்படுத்துகிறோம்.
ஆரம்ப வெளியீட்டில், விளையாட்டு இயக்கவியல், சூழல் உருவாக்கம், கதாபாத்திர அசைவூட்டம், இடைமுக வடிவமைப்பு மற்றும் ஒலி வடிவமைப்பு உள்ளிட்ட பொதுவான Roblox மேம்பாட்டுப் பணிகளிலிருந்து பெறப்பட்ட சூழ்நிலைகள் உள்ளன. OpenGameEval பெஞ்ச்மார்க், செயல்படுத்தக்கூடிய யூனிட் சோதனைகளைப் பயன்படுத்தி, தரவுத்தொகுப்பில் ஒரு மாதிரியின் செயல்திறனை அளவிட, pass@k, cons@k, மற்றும் all@k போன்ற தொழில்-தரநிலை அளவீடுகளுடன் அதன் மதிப்பெண் முறைமையைச் சீரமைக்கிறது. ஆராய்ச்சி கூட்டாளர்கள் OpenGameEval ஓட்டங்களிலிருந்து மதிப்பீட்டு முடிவுகளைச் சேகரித்த பிறகு, இந்த அளவீடுகளைத் தாங்களாகவே மீண்டும் உருவாக்கலாம்.
வழக்கமான செயல்பாட்டு-நிலை குறியீட்டு சவால்களைப் போலல்லாமல், OpenGameEval முக்கிய கூறுகளின் முழுமையான சோதனையை செயல்படுத்துகிறது. ஒரு வெற்றிகரமான மாதிரி, நிகழ்வு வரிசைமுறையை வழிநடத்துதல், பொருளின் நிலையை பகுப்பாய்வு செய்தல், மற்றும் சூழலிலிருந்து பயனரின் நோக்கத்தை அறிந்துகொள்ளுதல் போன்ற பல தனித்துவமான திறன்களில் தேர்ச்சி பெற்றிருக்க வேண்டும்.
பன்முனைப் பணிகள் மற்றும் சூழல் சார்ந்த மாறுபாடு
ராப்லாக்ஸ் கோடிங் பணிகள், ஒரு அனுபவத்தில் உள்ள தற்போதைய சூழலை வழிநடத்தவும், விரும்பிய விளைவை அடைய ஒன்றுடன் ஒன்று பிணைந்த பல ஸ்கிரிப்ட்கள் மற்றும் நிகழ்வுகளை ஆராயவும் பெரும்பாலும் பல படிகளைக் கோருகின்றன. கீழே உள்ள எடுத்துக்காட்டில், ஒரு மாதிரி தொடர்புடைய பல ஸ்கிரிப்ட்கள், கிளையன்ட்/சர்வர் தொடர்பு மற்றும் உரையின் அசல் நோக்கம் ஆகியவற்றை முறையாகக் கருத்தில் கொள்ளுமா என்பதை உறுதிப்படுத்த, உண்மையான விளையாட்டு நிகழ்வு சூழலைப் பிரதிநிதித்துவப்படுத்தும் ஒரு சாண்ட்பாக்ஸில் OpenGameEval பல காரணிகளைச் சரிபார்க்கிறது.
பயனர் உரை: சேதம் அடைந்த இரண்டு வினாடிகளுக்குப் பிறகு தொடங்கி, வினாடிக்கு 10 ஆரோக்கியத்தைப் புதுப்பிக்கும் ஒரு ஆரோக்கியப் புனரமைப்பு அமைப்பைச் செயல்படுத்தவும். பிளேஸ்ஃபைல் சூழல்: ஏற்கனவே ஆயுதங்கள், அணிகள் மற்றும் முக்கிய விளையாட்டு வழிமுறைகளுடன் அமைக்கப்பட்ட ஒரு லேசர் டேக் அனுபவம். எதிர்பார்க்கப்படும் பகுத்தறிவு படிகள்:
சரிபார்க்கக்கூடிய மதிப்பீடு: செயல்படுத்தக்கூடிய சோதனை (பாதுகாக்கப்பட்ட விளையாட்டு நிகழ்வில் இயக்கப்படுகிறது) சோதனை வீரருக்கு ஒரு சேத நிகழ்வைத் தூண்டி, பின்வருவனவற்றைச் சரிபார்க்கிறது:
|

ஒரு AI மாதிரியின் வலிமையையும் சூழல் சார்ந்த புரிதலையும் திறம்படச் சோதிக்க, பல்வேறு சூழல் நிலைகளின் கீழ் பணிகள் வழங்கப்படுகின்றன. உதாரணமாக, "நான்கு வழி போக்குவரத்து விளக்கிற்கு ஸ்கிரிப்டிங் செய்தல்" என்ற பணியில், மேம்பாட்டுச் சூழலின் தொடக்க நிலையின் அடிப்படையில் மூன்று சூழல் சார்ந்த மாறுபாடுகள் உள்ளன.
பயனர் உரை: எனக்கு ஒரு எளிய நான்கு வழி டிராஃபிக் விளக்குக்கான ஸ்கிரிப்டை எழுதுங்கள். மாற்றம் 1: ஒரு பேஸ்பிளேட்டை மட்டுமே கொண்ட ஒரு வெற்று பிளேஸ்ஃபைல். ஸ்கிரிப்ட் இல்லாமல் TrafficLight என்ற பெயரில் ஒரு போக்குவரத்து விளக்கு மாதிரி கிடைக்கிறது. அது TrafficLight மாடலுக்குள் உள்ள வெவ்வேறு பகுதிகளை ஆராய்ந்து, ஆன்/ஆஃப் நிலையை மாற்றுவதற்கான ஒரு வழியைக் கண்டறிய வேண்டும். மாற்றம் 2: புறநகர்ப் பகுதி அமைப்பு கொண்ட ஒரு பிளேஸ்ஃபைல். ஸ்கிரிப்டுகள் இல்லாமல் டிராஃபிக் சிக்னல் எனப் பெயரிடப்பட்ட பல டிராஃபிக் லைட் மாடல்கள் கிடைக்கின்றன. மாதிரி முதலில் மற்ற நிகழ்வுகளுக்கு மத்தியில் போக்குவரத்து விளக்குகளைச் சரியாக அடையாளம் காண அனுபவத்தைத் தேட வேண்டும். போக்குவரத்து விளக்கு மாதிரிகள் வகை 1-ஐ விட வேறுபட்ட தர்க்கத்துடன் கட்டமைக்கப்பட்டுள்ளன, மேலும் இந்த அனுபவத்திற்குத் தனித்துவமான ஒரு தீர்வை மாதிரி செயல்படுத்த வேண்டும். மாற்றம் 3: புறநகர்ப் பகுதி அமைப்பு கொண்ட ஒரு பிளேஸ்ஃபைல். பல போக்குவரத்து விளக்கு மற்றும் பாதசாரி சிக்னல் மாதிரிகள் கிடைக்கின்றன. போக்குவரத்து விளக்குகளுக்கான ஸ்கிரிப்டுகள் நீக்கப்பட்டிருந்தாலும், பாதசாரி சிக்னல்களுக்கான ஸ்கிரிப்டுகள் அப்படியே உள்ளன. மாதிரி, போக்குவரத்து விளக்குகளுக்கும் பாதசாரி சிக்னல்களுக்கும் இடையிலான வேறுபாட்டைக் கண்டறிந்து, சரியான பொருட்களில் மாற்றங்களைச் செய்ய வேண்டும். பாதசாரி சிக்னல்கள் இருப்பது மாதிரியைக் குழப்புகிறதா அல்லது அதற்கு உதவுகிறதா? |


பல்வேறு சூழல்கள் மற்றும் மாறுபட்ட சூழல் மற்றும் சிக்கலான தன்மைகளைக் கொண்ட, ஒரே மாதிரியானதாகத் தோன்றும் பணிகளில் மாதிரிகளின் நடத்தை புரிந்துகொள்ள நாங்கள் ஆர்வமாக உள்ளோம்.
ஆரம்பகட்ட முடிவுகள்
OpenGameEval பெஞ்ச்மார்க், ஊடாடும் மேம்பாட்டில் உள்ள AI உதவியாளர்களின் தற்போதைய நிலையைக் கண்டறிய அனுபவப்பூர்வமான தரவை வழங்குகிறது. தனிப்பட்ட செயல்பாடுகளில் உள்ள திறன்களுக்கும், பல-படி சூழல் பகுத்தறிவு தேவைப்படும் செயல்பாடுகளுக்கும் இடையிலான வேறுபாட்டைக் காட்ட சோதனை நிகழ்வுகள் வடிவமைக்கப்பட்டுள்ளன.
எங்கள் ஆரம்ப சோதனைகள், மாதிரிகள் பொதுவாக அணு செயல்பாடுகளில் சிறந்து விளங்குகின்றன, ஆனால் சூழல் சார்ந்த பகுத்தறிவில் சிரமப்படுகின்றன என்பதை வெளிப்படுத்தின. ஒரு துகள் வெளியீட்டாளரை அமைப்பது அல்லது ஒரு வீரரின் குதிக்கும் சக்தியை மாற்றுவது போன்ற, ஒற்றை, நேரடி நிகழ்வு கையாளுதல் தேவைப்படும் பணிகளில் அவை மிக உயர்ந்த வெற்றி விகிதங்களை அடைகின்றன. முன்னணி மாதிரிகள் கிட்டத்தட்ட சரியான வெற்றியை வெளிப்படுத்துகின்றன, இது சொற்றொடர் குறியீடு உருவாக்கம் மற்றும் அடிப்படை API அறிவு ஆகியவற்றில் அவற்றின் திறனை நிரூபிக்கிறது.
இதற்கு நேர்மாறாக, ஒருங்கிணைந்த செயல்பாடு, சூழல் சார்ந்த வடிகட்டுதல் மற்றும் ஆழமான API ஒருங்கிணைப்பு தேவைப்படும் பணிகளில் ஒரு குறிப்பிடத்தக்க இடைவெளி நிலவுகிறது. மேலே உள்ள உடல்நலப் புத்துணர்ச்சி அமைப்பு மற்றும் நான்கு வழி போக்குவரத்து விளக்கு போன்ற எடுத்துக்காட்டுகள், அனைத்து மாதிரிகளிலும் மிகக் குறைந்த pass@k மதிப்பெண்களைத் தொடர்ந்து அளிக்கின்றன.
வேகமான பரிணாமம்
மாடல்கள் தொடர்ந்து பரிணமிப்பதால், இந்த இடைவெளிகள் குறையும் என்று நாங்கள் எதிர்பார்க்கிறோம், ஆனால் நாங்கள் ஏற்கனவே சுவாரஸ்யமான முன்னேற்றங்களைக் கண்டுள்ளோம். "கியூப் போன்ற ராப்ளாக்ஸ் லோகோவை பச்சையாக மாற்றவும்" என்று ஒரு மதிப்பீட்டுப் பணியில் மாடலைக் கேட்கும்போது, இலக்கு பொருளின் பெயரில் லோகோ அல்லது ராப்ளாக்ஸ் என்ற வார்த்தை வெளிப்படையாக இல்லாததால், ஆரம்பத்தில் மாடல்கள் அனைத்தும் தோல்வியடைவதை நாங்கள் கண்டோம்.

மேலும் சமீபத்திய மதிப்பீடுகள், சில மாதிரிகள் இப்போது இந்த வழக்கை, எளிய முக்கிய வார்த்தைப் பொருத்தத்தைத் தாண்டி கட்டமைப்பு சார்ந்த பகுத்தறிவுக்குச் செல்வதன் மூலமும், "Roblox லோகோவை" பிரதிநிதித்துவப்படுத்த அதிக வாய்ப்புள்ள பொருளைக் கண்டறிய, நெருங்கிய எடுத்துக்காட்டு ஆய்வு (பெயர் மட்டுமல்ல, பண்புகளையும் உள்ளடக்கியது) மற்றும் ஒருங்கிணைந்த அனுமானத்தை பயன்படுத்துவதன் மூலமும் வெற்றிகரமாகத் தீர்த்து வருகின்றன என்று காட்டுகின்றன.
அடுத்து என்ன?
AI துறையில் ஏற்படும் விரைவான முன்னேற்றங்களைக் கண்காணிக்க, ஓப்பன் கேம்எவலைத் தொடர்ந்து விரிவுபடுத்தவும் பராமரிக்கவும் நாங்கள் உறுதிபூண்டுள்ளோம். தற்போதைய ஓப்பன் கேம்எவல் கட்டமைப்பு மற்றும் அளவுகோல் ஒரு அடித்தளம் மட்டுமே. ராப்லாக்ஸ் ஸ்டுடியோ ஏஜென்டிக் AI உதவியாளர் மதிப்பீட்டிற்கான தரமாக இந்தத் தளம் நீடிப்பதை உறுதிசெய்ய, எங்கள் உத்திப்பூர்வமான வழிகாட்டி மூன்று முக்கிய இலக்குகளில் கவனம் செலுத்துகிறது:
- செயல்திறன் வெளிப்படைத்தன்மை மூலம் படைப்பாளர்களை மேம்படுத்துதல்: படைப்பாளிகள் மாடல்களை ஒப்பிட்டுப் பார்க்கவும், குறியீடு உருவாக்கம், சொத்துச் செருகல் மற்றும் கருவி ஒருங்கிணைப்பு ஆகியவற்றில் செயல்திறனைப் புரிந்துகொள்ளவும் உதவும் தெளிவான, வெளிப்படையான சுருக்கங்களை வழங்கும் அதே வேளையில், நாங்கள் வழக்கமாக லீடர்போர்டு மற்றும் பெஞ்ச்மார்க் தரவுத்தளத்தை புதுப்பிப்போம்.
- ஆராய்ச்சி மற்றும் மேம்பாட்டை விரைவுபடுத்துதல்: மதிப்பீட்டைத் தரப்படுத்த, நாங்கள் API அடாப்டரைப் பராமரித்து விரிவுபடுத்துவோம். இது, ஆராய்ச்சி கூட்டாளர்கள் அடுத்த தலைமுறை AI உதவியாளர்களை உருவாக்குவதற்காக, வேகமான, தடையற்ற, மீண்டும் உருவாக்கக்கூடிய அளவுகோல்களை இயக்க உதவும்.
- சமூகத்தால் இயக்கப்படும் அணுகுமுறையைக் கையாளுதல்: நிஜ உலக படைப்பாளிகளின் நோக்கங்களை நாங்கள் தொடர்ந்து ஒருங்கிணைப்போம், மேலும் இந்த அளவுகோல், அதிநவீன Roblox மேம்பாடு மற்றும் முன்னேறும் AI திறன்களைப் பிரதிபலிப்பதை உறுதிசெய்ய சமூகத்தின் பங்களிப்புகளைத் தீவிரமாகக் கோருவோம்.
இவை அனைத்தும் சேர்ந்து, இந்த கட்டமைப்பு, தரவுத்தொகுப்பு மற்றும் பொதுவான லீடர்போர்டு ஆகியவை OpenGameEval-ஐ Roblox மேம்பாட்டில் AI-ஆல் இயக்கப்படும் படைப்புகளை மதிப்பிடுவதற்கான ஒரு வெளிப்படையான, கூட்டு அடித்தளமாக ஆக்குகின்றன. இது முழுமையான படைப்பாளிகள் சமூகத்திற்கு முன்னேற்றத்தை அளவிடவும், நுண்ணறிவுகளைப் பகிர்ந்து கொள்ளவும், சிறந்த உதவியாளர்களை உருவாக்கவும் உதவுகிறது.


