رئیس علی بابا: عوامل هوش مصنوعی می توانند صحبت کنند، اما آیا واقعا می توانند کار را انجام دهند؟
قویترین مدل مرزی که ما آزمایش کردیم، 61.7٪ از وظایف را با موفقیت انجام داد - به اندازهای بالا که مفید باشد و به اندازهای پایین که یک هشدار باشد.
خواندن متن کامل در فورچونبه زبان اصلی، در سایت ناشر باز میشودمتن اصلی (انگلیسی)
Alibaba President: AI agents can talk, but can they actually do the work?
The strongest frontier model we tested successfully completed 61.7% of the tasks — high enough to be useful and low enough to be a warning.