واترمارکینگ حفظ عملکرد پروتئین های تولید شده توسط هوش مصنوعی
طبیعت، انتشار آنلاین: 30 سپتامبر 2026; doi:10.1038/s41586-026-10965-y SynthIDBio با حفظ عملکرد، توالی ها و ساختارهای پروتئین تولید شده توسط هوش مصنوعی را واترمارک می کند، تشخیص منشأ را قادر می سازد و ابزار اثبات مفهومی برای امنیت زیستی و یکپارچگی اطلاعات ارائه می دهد.
مدلهای هوش مصنوعی مولد (AI) با ابزارهایی مانند AlphaFold 3 و مدلهای طراحی پروتئین، پیشرفتها در پیشبینی ساختار پروتئین و ایجاد پروتئینهای کاربردی جدید را تسریع میکنند. ردیابی و ایجاد منشأ توالیها و ساختارهای پروتئینی تولید شده توسط هوش مصنوعی برای مقابله با طیفی از چالشهای نوظهور، از جمله امنیت زیستی و نگرانیهای مربوط به صحت اطلاعات، اهمیت فزایندهای پیدا میکند.
در اینجا ما SynthIDBio را معرفی میکنیم، خانوادهای از روشها برای واترمارک کردن توالیها و ساختارهای پروتئینی برای تعیین منشأ آنهایی که با هوش مصنوعی تولید میشوند. SynthIDBio-sequence به طور فعال یک واترمارک را در توالی های پروتئینی جاسازی می کند و در عین حال عملکرد خود را حفظ می کند. ما این را با ایجاد پیوندهای پروتئینی طراحی شده با واترمارک و عملکردی با میل ترکیبی قابل مقایسه با همتایان بدون واترمارک و دقت تشخیص واترمارک تقریبا عالی نشان میدهیم. علاوه بر این، ساختار SynthIDBio، یک مدل AlphaFold3 بهخوبی تنظیم شده، یک واترمارک نامحسوس را در ساختارهای بیومولکولی تعبیه میکند.
کار ما اثبات مفهومی است که نشاندهنده حفظ عملکرد بیولوژیکی امکانپذیر است، و یک ابزار بالقوه برای منشأ در عصر مهندسی بیولوژیکی مبتنی بر هوش مصنوعی که به سرعت در حال گسترش است، معرفی میکند.
هوش مصنوعی کشف و طراحی بیولوژیکی را با کاربردهای گسترده در درمان، تشخیص و تحقیقات زیست پزشکی سرعت می بخشد. مدلهای تخصصی برای طراحی پروتئین و پیشبینیهای ساختاری در حال تبدیل شدن به بخشی جدایی ناپذیر از گردش کار بیولوژیکی هستند. اطمینان از استفاده ایمن و مسئولانه از آنها شامل توانایی تعیین و ردیابی مدل اصلی توالی ها و ساختارهای تولید شده توسط هوش مصنوعی است. این نویدبخش رفع چالشهای بالقوه است که از پذیرش گسترده مدلهای هوش مصنوعی قویتر در زیستشناسی، از جمله امنیت زیستی و صحت اطلاعات ناشی میشود.
در اینجا، اطلاعات مربوط به منشأ ممکن است به سیگنال مفیدی برای ارائه دهندگان سنتز DNA 2، 4، 6، 7، 8 و مؤسسات مدیریت پایگاه های داده بیولوژیکی مانند بانک داده های پروتئین (PDB) 9، UniProt 10 یا GenBank 11 تبدیل شود.
چندین روش برای تعیین منشأ برای اشیاء بیولوژیکی پیشنهاد شده است، از جمله از طریق پایگاه های داده متمرکز یا با مرتبط کردن ابرداده در مورد فرآیند طراحی با دنباله بیولوژیکی 2، 12. پایگاه های داده نیاز به هماهنگی مرکزی دارند، در مقیاس مستعد مثبت کاذب هستند و ممکن است باعث ایجاد چالش هایی در حفظ حریم خصوصی شوند. در مقابل، ابرداده امضا شده رمزنگاری شده میتواند حریم خصوصی را حفظ کند، اما حذف آن آسان است. یک رویکرد جایگزین، واترمارکینگ، امضاها را در خود اشیاء تولید شده توسط هوش مصنوعی تعبیه می کند.
این رویکرد با موفقیت در متون و چند رسانه ای تولید شده توسط هوش مصنوعی اعمال شده و در محصولات مختلف از جمله هوش مصنوعی 13، 14 مولد Google به کار گرفته شده است. واترمارک ها به دلیل نامحسوس بودن، قابلیت تشخیص بالا و حفظ کیفیت را می دهند. آنها جایگزینی برای حفظ حریم خصوصی ارائه می دهند که در آن حذف اطلاعات در مورد منشأ چالش برانگیزتر است و نیازی به هماهنگی مرکزی نیست. علاوه بر این، واترمارکینگ میتواند منشأ پیشبینیهای مدل باز را ایجاد کند.
با این حال، مشخص نیست که آیا روشهای واترمارک موجود به روشهای بیولوژیکی منتقل میشوند که حفظ کیفیت به استفاده مورد نظر پروتئین مربوط میشود: برای طراحی پروتئین، این نیاز به حفظ عملکرد بیولوژیکی قابل تأیید تجربی دارد. برای پیشبینی ساختاری، شامل حفظ دقت ویژگیهای ساختاری پیشبینیشده، حصول اطمینان از اینکه تفسیر محقق و فرضیههای عملکرد بیولوژیکی بعدی بدون تغییر باقی میمانند. کار همزمان برای واترمارک کردن توالی پروتئین محدود به آزمایشهای سیلیکو با ساختارهای مونومر نوع وحشی از PDB 3 است.
روش های فعلی منجر به کاهش قابل توجه دقت 15 هنگام واترمارک کردن ساختارهای پروتئینی می شود. در مجموع، اینها نشان می دهد که علامت گذاری با حفظ عملکرد هنوز در دسترس نیست.
ما SynthIDBio را معرفی میکنیم، خانوادهای از روشها برای جاسازی واترمارکهای بسیار قابل تشخیص و در عین حال حفظ عملکرد مستقیما در توالیها و ساختارهای بیولوژیکی. SynthIDBio-sequence روشی برای طراحی بایندرهای پروتئینی واترمارک شده است. به دنبال شکل 1a، SynthIDBio-sequence واترمارکینگ را در ProteinMPNN 16 ادغام می کند، که یک مدل طراحی توالی معمولی است که قبل از استفاده از معیارهای ساختاری برای فیلتر کردن طرح ها به کلاسورهای پیش بینی شده 17، 18 در بالای ساختار ستون فقرات اعمال می شود.
ما نشان میدهیم که قابلیت تشخیص واترمارک را میتوان با حداقل کاهش عملکرد سیلیکو تضمین کرد و استحکام واترمارک را برای حذف عمدی بررسی کرد. از طریق اعتبار سنجی آزمایشگاهی، ما بایندرهای پروتئینی کاربردی و دارای واترمارک بیولوژیکی به دست آوردیم: بایندرهای نانومولاری کم برای دامنه اتصال گیرنده SARS-CoV-2 (SC2RBD) و بایندرهای زیر نانومولاری برای فاکتور رشد اندوتلیال عروقی A (VEGF-A) و لیگاند مرگ برنامه ریزی شده 1 (PD-L1).
طراحی آزمایشی ما از ستون فقرات شناخته شده AlphaProteo 17 استفاده کرد که با استفاده از ProteinMPNN با یا بدون دنباله SynthIDBio توالی یابی شدند. در میان اهداف و ستونهای ستون فقرات، متوجه میشویم که واترمارکینگ بر توزیع تمایل اتصال یا نرخ ضربه اتصال تأثیری نمیگذارد.
طراحی پروتئین سرتاسر با SynthIDBio-sequence. در طول نمونهبرداری، بر اساس ستون فقرات تولید شده، از ProteinMPNN با نمونهبرداری مسابقات SynthID-text برای نمونهبرداری از دنبالههای واترمارک شده استفاده میکنیم که سپس با استفاده از معیارهای مشتقشده از AF3 و آستانه شناسایی بیشتر واترمارک (wm) که به FPR هدف کالیبره میشود، فیلتر میشوند. در زمان تست، ما از کلید مخفی واترمارک مورد استفاده در هنگام نمونه برداری برای تشخیص واترمارک استفاده می کنیم.
b، ماژولهای انتشار و اطمینان AF3 (آبی) را برای به دست آوردن ساختار SynthIDBio، که شامل یک واترمارک نامحسوس در هر پیشبینی ساختار است، تنظیم دقیق میکنیم. ما همچنین یک آشکارساز واترمارک (آبی) را با اضافه کردن یک افت واترمارک اضافی (نارنجی) به تلفات انتشار AF3 آموزش میدهیم. فرآیند نمونه برداری با استفاده از ماژول انتشار دقیق بدون تغییر باقی می ماند. در زمان آزمایش، آشکارساز واترمارک را می توان به صورت مستقل برای شناسایی ساختارهای واترمارک استفاده کرد. آشکارساز مخفی باقی می ماند و با کاربران مدل AF3 تنظیم شده به اشتراک گذاشته نمی شود.
ما همچنین ساختار SynthIDBio را ارائه میکنیم - مدلی که از AlphaFold 3 (AF3) 19 تنظیم شده است که ساختارهای واترمارک شده را با حفظ دقت ساختاری پیشبینی میکند. به دنبال شکل 1b، ماژول انتشار AF3 را به دقت تنظیم می کنیم، آن را با یک آشکارساز واترمارک که توسط یک هدف واترمارکی که مستقیما در از دست دادن انتشار AF3 ادغام شده است هدایت می شود. همانطور که در مجموعه ارزیابی AF3 تایید شده است، ساختار SynthIDBio قابلیت تشخیص تقریبا کامل را با تأثیر ناچیز بر دقت جهانی و تأثیر حداقلی بر هندسه پیوند ارائه می دهد.
واترمارک ها در برابر دستکاری های اساسی از جمله تبدیل های صلب و نویز مقاوم هستند. اعتبار سنجی کیفی نشان می دهد که ساختار SynthIDBio با موفقیت اطلاعات واترمارکینگ را در فواصل اتم-اتم پنهان می کند، که از واریانس طبیعی پیش بینی های خود AF3 نسبت به حقیقت زمین قابل تشخیص نیست.
SynthIDBio اثبات فنی مفهومی را ارائه میکند که نشاندهنده بیولوژیکی حفظ عملکرد و کیفیت امکانپذیر است. ما همچنین موارد استفاده بالقوه را مورد بحث قرار می دهیم، از جمله برای امنیت زیستی و یکپارچگی علمی، که در آن انتظار داریم توانایی ردیابی قابل اعتماد منشأ در آینده مهم باشد. با این حال، عملیاتی کردن SynthIDBio برای این برنامه ها علاوه بر هماهنگی و استانداردسازی در سطح صنعت، به نوآوری بیشتری نیاز دارد.
رویکردهای اخیر برای طراحی بایندر پروتئین بر تولید ساختار هدف-شرط و به دنبال آن طراحی توالی با استفاده از ProteinMPNN 16، 17، 18، 20 متکی است (شکل 1a). ProteinMPNN، با رمزگشایی از چپ به راست، توالیهای مجزا از اسیدهای آمینه را با نمونهبرداری از توکنها (باقیماندهها) xt در هر مرحله t، از توزیع p (⋅∣ x < t) که مشروط به زمینه قبلی است، تولید میکند.
برای واترمارک کردن توالیهای نمونهبرداری شده، استراتژی نمونهگیری را از متن SynthID، به نام نمونهگیری مسابقات، اعمال میکنیم که توزیع نمونه p (⋅∣ x < t ) را با استفاده از یک بذر تصادفی r t مشتق شده از زمینه قبلی و یک کلید مخفی watermarking k . به طور خاص، زمینه قبلی می تواند H-gram باشد، یعنی xt-H، …، xt-1، و دانه تصادفی 21، 22 از یک تابع هش f r (xt-H: t-1، k) که به H-gram و k اعمال می شود، مشتق شده است.
توزیع با استفاده از توابع به اصطلاح امتیازدهی (همچنین به نام توابع g، g (xt، r t)) که، مشروط به دانه تصادفی، یک امتیاز باینری به هر نشانه ممکن xt اختصاص میدهد، سوگیری میکند. نمونه گیری مسابقات به صراحت این مقادیر g را به حداکثر می رساند. با آگاهی از کلید مخفی k، واترمارک را می توان با محاسبه مجدد H-gram و ارزیابی توابع امتیازدهی در زمان آزمون شناسایی کرد. انتظار میرود توالیهای واترمارکشده امتیاز بالاتری داشته باشند، بهطور میانگین در سراسر دنباله، با توالیهای بدون واترمارک نزدیک به انتظار صفر 0.5 امتیاز کسب کنند.
در نهان نگاری متن، قابلیت تشخیص با توالی های طولانی تر یا آنتروپی بالاتر در توزیع های p (⋅∣ x < t ) 13 بهبود می یابد. مورد دوم به وظیفه بستگی دارد و می تواند با تعدیل دمای نمونه برداری ProteinMPNN تحت تأثیر قرار گیرد.
با استفاده از توابع امتیاز دهی باینری g، که در آن به هر توکن ممکن x t امتیاز 0 یا 1 اختصاص داده می شود، نمونه گیری مسابقات به توکن های نامزد اجازه می دهد تا با یکدیگر رقابت کنند. در سادهترین نمونه یک لایه (L = 1)، از دو نشانه کاندید نمونهبرداری میکنیم و نامزدی را با امتیاز بالاتر انتخاب میکنیم (یا نمونه یکنواخت در صورت تساوی). این را می توان به لایه های L > 1 گسترش داد و یک واترمارک قوی تر را به شرح زیر معرفی کرد. در ابتدا، برای لایه l = 1، از 2 L کاندید نمونه برداری می کنیم و اجازه می دهیم جفت ها با استفاده از تابع امتیاز دهی g با کلید k1 با یکدیگر رقابت کنند.
برای لایه l = 2، با استفاده از 2 L-1 کاندید باقی مانده، این فرآیند را با کلید k 2 و غیره تکرار می کنیم. پس از لایه های L، تنها یک نامزد باقی می ماند. در عمل، این میتواند بهعنوان یک تبدیل در بالای لاجیتهای ProteinMPNN پیادهسازی شود، و از نیاز به نمونهبرداری صریح از توکنهای کاندید 2 لیتری اجتناب شود. در نتیجه، ما مجموعه ای از امتیازات باینری L را در هر توکن به دست می آوریم. میانگین گرفتن در لایههای l و نشانههای t میانگین g-value مورد استفاده برای تشخیص را به دست میدهد.
استفاده از کلیدهای منحصربهفرد k l برای هر لایه، بدون تحریف است، به این معنا که توزیع توکن و توالی در انتظار بیش از کلیدهای kl بدون تغییر باقی میمانند (مراجعههای 13، 23). در مقابل، تکرار کلیدها به صراحت باعث ایجاد اعوجاج می شود و می تواند قابلیت تشخیص را افزایش دهد. با این حال، تأکید بر این نکته مهم است که این و مفاهیم مشابه از اعوجاج، توزیعها را بر روی نشانهها در نظر میگیرند، نه معنایی. کاملا ممکن است که یک واترمارک تحریف کننده هیچ تأثیری بر عملکرد پروتئین نداشته باشد. این فقط از طریق آزمایش تجربی قابل تعیین است.
از آنجایی که دمای ProteinMPNN معمولا برای کارهای طراحی پروتئین پایین است 17، 18 برای کاهش آنتروپی در طول طراحی، ما از واترمارکینگ اعوجاجی برای دماهای پایین استفاده میکنیم.
به طور معمول در طراحی پروتئین، یک مدل یک ساختار ستون فقرات طراحی ایجاد میکند، که سپس با استفاده از ProteinMPNN برای تولید طرح نهایی، توالیبندی میشود. این طرحها سپس با استفاده از آستانههای معیارهای ساختاری مختلف از یک مدل تاشو پروتئین (به عنوان مثال، AF3)، همانطور که در شکل 1a نشان داده شده است، فیلتر میشوند. استفاده از فیلترها بسته به هدف می تواند منجر به نرخ عبور به صورت تک رقمی یا دو رقمی کم شود.
از آنجایی که فیلترها در بالای طرحها اعمال میشوند، واترمارک میتواند بر توزیع معیارها تأثیر بگذارد و در نتیجه نرخ عبور را کاهش دهد در حالی که فیلترها میتوانند طرحهای دارای واترمارک قوی را رها کنند و در نتیجه قابلیت تشخیص واترمارک را کاهش دهند. ما اولی را با ایجاد نامزدهای کافی و دومی را با افزایش قابلیت تشخیص به شرح زیر مقابله میکنیم: دمای نمونهبرداری را از پیشفرض 0.1 افزایش میدهیم، که همچنین با کاهش تنوع ناشی از واترمارک کردن مقابله میکند، یا با استفاده از واترمارک اعوجاجی 24.
برای اولی، دماهای 0.3 و 0.5 را در نظر می گیریم و برای دومی از همان کلید kl در سراسر لایه ها استفاده می کنیم (هر دو با H = 4 و L = 25). برای اعتبار سنجی آزمایشگاهی، ما هر دو واترمارک بدون تحریف و تحریف را با دمای 0.5 و 0.1 انتخاب کردیم. این تنظیمات به این دلیل انتخاب شدند که ارزیابی دماهای بالا (افزایش آنتروپی) و علامت گذاری قوی تر (افزایش اعوجاج) را بر روی میل اتصال را فعال می کردند. ما با طرح های بدون واترمارک در دمای 0.1 مقایسه می کنیم.
علاوه بر این، طرح ها بر اساس یک آستانه g-value مدرج شده برای هر دو تجزیه و تحلیل سیلیکونی و آزمایشگاهی فیلتر می شوند. همانطور که در روشها توضیح داده شد، این آستانهها به یک نرخ مثبت کاذب هدف (FPR) روی مجموعهای از طرحهای نگهداشتهشده و بدون واترمارک در 23 هدف مختلف و همچنین توالیهای پروتئین طبیعی از PDB و UniRef50 کالیبره میشوند (مراجعههای 25، 26). این آستانه یک نرخ مثبت 100٪ واقعی (TPR) را به قیمت فیلتر کردن سختگیرانهتر فراهم میکند.
بر خلاف طراحی پروتئین، که توالی ها را پیش بینی می کند، مدل های تاشو مانند AF3 (رجوع 19) ساختار مختصات سه بعدی پیوسته اتم ها را پیش بینی می کند. این مدلها معمولا در دسترس عموم قرار میگیرند، به این معنی که واترمارکینگ مبتنی بر نمونهگیری یا پسهک را میتوان به راحتی دور زد. برای جلوگیری از این امر، رویکرد ما با تنظیم دقیق مدل با استفاده از یک هدف واترمارک اضافی، ابزارهای واترمارک را مستقیما در وزن های مدل تعبیه می کند.
AF3 متشکل از یک تنه است که نمایشهایی از توالیهای پروتئین را ایجاد میکند و به دنبال آن یک ماژول انتشار که به طور مکرر ساختارهای تا شده را ایجاد میکند و یک سر اطمینان که دقت پیشبینی را تخمین میزند (شکل 1b) است.
ما روی ماژول انتشار AF3 تمرکز میکنیم که، مشروط به ویژگیهای میانی، مختصات سه بعدی را در تکرارهای T حذف نویز گاوسی سه بعدی ایجاد میکند. ماژول انتشار با یک هدف حذف نویز استاندارد، \({{\mathcal{L}}}_{{\rm{تفاوت}}}\) آموزش داده شده است که بر اساس کار قبلی 27 است. برای جاسازی واترمارک، یک شبکه آشکارساز معرفی میکنیم و ماژول انتشار را با استفاده از یک تابع از دست دادن ترکیبی تنظیم میکنیم. آشکارساز برای تمایز بین ساختارهای دارای واترمارک، بدون واترمارک و ساختارهای حقیقت زمینی از طریق از دست دادن آنتروپی متقاطع باینری، \({{\mathcal{L}}}_{{\rm{wm}}}\) آموزش دیده است.
ما این را با از دست دادن انتشار ترکیب می کنیم تا کل هدف آموزشی را تشکیل دهیم:
که در آن w wm یک ابرپارامتر است که سهم هدف واترمارکینگ را وزن می کند، که آن را w wm = 0.1 قرار می دهیم. از دست دادن سر اعتماد به نفس بدون تغییر باقی می ماند.
معماری آشکارساز از PointNet 28 الهام گرفته شده است. ابتدا با محاسبه ویژگی های هندسی درون باقیمانده مانند فواصل اتم-اتم و زاویه پیچش عمل می کند. سپس این ویژگی ها از طریق چندین لایه پیچش 1 بعدی بر اساس هر باقیمانده پردازش می شوند. نقشههای ویژگی بهدستآمده، قبل از اینکه به یک سر خطی نهایی برای طبقهبندی منتقل شوند، با ادغام متوسط جمعآوری میشوند.
برای افزایش استحکام واترمارک در طول تمرین، نویز را به مختصات ساختار پیشبینیشده قبل از ارسال به آشکارساز تزریق میکنیم. این با اضافه کردن نویز یکنواخت نمونه برداری شده از U (-s، s)، با s ∈ {0.1، 0.01، 0.001} Å به دست می آید. ما به طور کلی دریافتیم که حداقل اغتشاش (s ≥ 0.001) برای اطمینان از ماندگاری واترمارک زمانی که ساختارها در قالبهای فایل رایج ذخیره میشوند، مانند فایل اطلاعات کریستالوگرافی (CIF) 29 مورد نیاز است، که معمولا مختصات اتمی را تا سه نقطه اعشار گرد میکند.
از آنجایی که فواصل اتم-اتم و زوایای پیچشی که آشکارساز استفاده میکند نسبت به تبدیلهای صلب تغییر نمیکند، واترمارکهای ما برای چنین تبدیلهایی با ساخت مقاوم هستند.
برای اینکه واترمارکینگ توالی پروتئین یک مداخله عملی باشد، نباید استفاده مورد نظر از پروتئین را مختل کند. برای تأیید اینکه واترمارکینگ بر عملکرد بایندرهای پروتئینی تأثیر نمیگذارد، ما اندازهگیریهای میل ترکیبی اتصال در شرایط آزمایشگاهی بایندرهای غیر واترمارک شده و واترمارکینگ را در برابر سه هدف انجام دادیم: SC2RBD، VEGF-A و PD-L1، به عنوان زیرمجموعهای نماینده یک مطالعه گذشته 17. برای هر هدف، ما از 15 ستون فقرات از طرح های موجود با میل اتصال شناخته شده از کمپین های تاریخی AlphaProteo استفاده کردیم. این ستون فقرات از طریق کاربرد بیشتر ProteinMPNN مجددا تعیین شد.
ما از ستون فقرات کلاسورهای شناخته شده شروع کردیم، به جای اجرای یک طراحی کامل de novo برای افزایش احتمال موفقیت اتصال در هر دنباله و در نتیجه مقدار داده های میل مفید جمع آوری شده. علاوه بر این، استفاده از چندین ستون فقرات در هر هدف، ارزیابی تأثیر توالی و تنوع ساختاری بر عملکرد واترمارک را امکانپذیر کرد.
برای هر ستون فقرات، ما 18 طرح را در مجموع آزمایش کردیم: یک دنباله والد (طراحی که قبلا تایید شده مربوط به ستون فقرات انتخاب شده)، پنج دنباله بدون واترمارک. شش از واترمارکینگ بدون اعوجاج با دمای 0.5. و شش از واترمارکینگ اعوجاجی با دمای 0.1. سه توالی در هر هدف به طور تصادفی با یک کنترل منفی (یکی در هر تنظیم مدل) متشکل از یک اتصال دهنده مجدد برای یک هدف جایگزین جایگزین شد.
در مجموع، بدون کنترل، ارزیابی آزمایشگاهی ما شامل 222 توالی بدون واترمارک و 267 دنباله واترمارک شده برای هر تنظیم واترمارکینگ بود. برای جزئیات کامل در مورد تنظیم مشخصات و پروتکل های آزمایشی به روش ها مراجعه کنید.
در شکل 2 ما کمترین تأثیر تنظیم واترمارکینگ را بر روی میل ترکیبی متوسط مییابیم که با طیفسنجی رزونانس پلاسمون سطحی (SPR) اندازهگیری شده و با استفاده از ثابت تفکیک KD بیان میشود (شکل 2a)، یا نرخ ضربه طبقهبندی شده با میل پیوند (شکل 2b). تفاوت قابل توجهی در سطح جمعیت در پیوندهای اتصال مشتق شده از SPR بین بایندرهای غیر واترمارکینگ و واترمارکینگ (با هر یک از تنظیمات) همانطور که توسط آزمون جمع رتبهای Wilcoxon دو دنباله اندازهگیری شد، وجود نداشت.
با این حال، کلاسورهایی که SC2RBD را هدف قرار میدهند و با اعوجاج 0.1 واترمارک شده بودند، میانگین KD به طور قابلتوجهی کمتر از آنهایی که با 0.5 بدون اعوجاج واترمارک شده بودند داشتند. با یک آستانه g-value کالیبره شده برای FPR 0.1٪، ما به طور خودکار یک TPR 100٪ برای تشخیص این طرح ها به دست می آوریم. تفاوت معنی داری در نرخ ضربه برای آستانه میل اتصال KD ≤ 10-7 وجود نداشت. با این حال، تفاوت قابلتوجهی بین نرخ ضربههای بدون تحریف 0.5 و غیر واترمارکینگ در آستانه KD ≤ 10-6 وجود دارد، با کلاسورهای غیر واترمارکینگ نرخ ضربه بالاتری دارند.
همه کنترل های منفی (9 نفر) هیچ اتصال قابل تشخیصی نداشتند. همانطور که در اطلاعات تکمیلی نشان داده شده است، همچنین متوجه شدیم که طرحهای دارای ترتیب مجدد اغلب نسبت پیوند بهتری نسبت به طرح اصلی دارند. این بهبود در توالی والد در تمایل به روش واترمارک نسبت داده نمی شود، بلکه نتیجه نمونه برداری تکراری و چند دور از ProteinMPNN است. ما بیشتر توالیهای واترمارکیشده را در یک همترازی توالی چندگانه و ساختار پیشبینیشده چسباننده واترمارکشده در تعامل با VEGF-A نشان میدهیم (شکل 2c,d).
همانطور که در هر دو پانل نشان داده شده است، سیگنال واترمارکینگ در سراسر پروتئین، از جمله در تمام انواع ساختارهای ثانویه توزیع می شود. همانطور که با ستون فقرات ثابت شروع کردیم، شکل 2e توزیع های 0.5 بدون اعوجاج و g-value بدون واترمارکی را در همه ستون های ستون فقرات برای PD-L1 نشان می دهد. این نشان میدهد که توانایی واترمارک کردن توالیها از طریق یک resequencer توسط ساختار ستون فقرات که ما در ProteinMPNN وارد میکنیم محدود شده است. به عنوان مثال، ما توزیع متفاوتی از مقادیر g را بین ستون فقرات 5 و 12 بدون واترمارک نشان میدهیم (آزمون مجموع رتبه Wilcoxon دو دنباله).
متن اصلی (انگلیسی)
Function-preserving watermarking of AI-generated proteins
Nature, Published online: 30 September 2026; doi:10.1038/s41586-026-10965-y SynthIDBio watermarks AI-generated protein sequences and structures while preserving function, enabling provenance detection and offering a proof-of-concept tool for biosecurity and information integrity.