پرش به محتوای اصلی

واترمارکینگ حفظ عملکرد پروتئین های تولید شده توسط هوش مصنوعی

نیچر۱۴۰۵ مهر ۸, چهارشنبه، ساعت ۰۳:۳۰حدود 14 دقیقه مطالعه

طبیعت، انتشار آنلاین: 30 سپتامبر 2026; doi:10.1038/s41586-026-10965-y SynthIDBio با حفظ عملکرد، توالی ها و ساختارهای پروتئین تولید شده توسط هوش مصنوعی را واترمارک می کند، تشخیص منشأ را قادر می سازد و ابزار اثبات مفهومی برای امنیت زیستی و یکپارچگی اطلاعات ارائه می دهد.

مدل‌های هوش مصنوعی مولد (AI) با ابزارهایی مانند AlphaFold 3 و مدل‌های طراحی پروتئین، پیشرفت‌ها در پیش‌بینی ساختار پروتئین و ایجاد پروتئین‌های کاربردی جدید را تسریع می‌کنند. ردیابی و ایجاد منشأ توالی‌ها و ساختارهای پروتئینی تولید شده توسط هوش مصنوعی برای مقابله با طیفی از چالش‌های نوظهور، از جمله امنیت زیستی و نگرانی‌های مربوط به صحت اطلاعات، اهمیت فزاینده‌ای پیدا می‌کند.

در اینجا ما SynthIDBio را معرفی می‌کنیم، خانواده‌ای از روش‌ها برای واترمارک کردن توالی‌ها و ساختارهای پروتئینی برای تعیین منشأ آن‌هایی که با هوش مصنوعی تولید می‌شوند. SynthIDBio-sequence به طور فعال یک واترمارک را در توالی های پروتئینی جاسازی می کند و در عین حال عملکرد خود را حفظ می کند. ما این را با ایجاد پیوندهای پروتئینی طراحی شده با واترمارک و عملکردی با میل ترکیبی قابل مقایسه با همتایان بدون واترمارک و دقت تشخیص واترمارک تقریبا عالی نشان می‌دهیم. علاوه بر این، ساختار SynthIDBio، یک مدل AlphaFold3 به‌خوبی تنظیم شده، یک واترمارک نامحسوس را در ساختارهای بیومولکولی تعبیه می‌کند.

کار ما اثبات مفهومی است که نشان‌دهنده حفظ عملکرد بیولوژیکی امکان‌پذیر است، و یک ابزار بالقوه برای منشأ در عصر مهندسی بیولوژیکی مبتنی بر هوش مصنوعی که به سرعت در حال گسترش است، معرفی می‌کند.

هوش مصنوعی کشف و طراحی بیولوژیکی را با کاربردهای گسترده در درمان، تشخیص و تحقیقات زیست پزشکی سرعت می بخشد. مدل‌های تخصصی برای طراحی پروتئین و پیش‌بینی‌های ساختاری در حال تبدیل شدن به بخشی جدایی ناپذیر از گردش کار بیولوژیکی هستند. اطمینان از استفاده ایمن و مسئولانه از آنها شامل توانایی تعیین و ردیابی مدل اصلی توالی ها و ساختارهای تولید شده توسط هوش مصنوعی است. این نویدبخش رفع چالش‌های بالقوه است که از پذیرش گسترده مدل‌های هوش مصنوعی قوی‌تر در زیست‌شناسی، از جمله امنیت زیستی و صحت اطلاعات ناشی می‌شود.

در اینجا، اطلاعات مربوط به منشأ ممکن است به سیگنال مفیدی برای ارائه دهندگان سنتز DNA 2، 4، 6، 7، 8 و مؤسسات مدیریت پایگاه های داده بیولوژیکی مانند بانک داده های پروتئین (PDB) 9، UniProt 10 یا GenBank 11 تبدیل شود.

چندین روش برای تعیین منشأ برای اشیاء بیولوژیکی پیشنهاد شده است، از جمله از طریق پایگاه های داده متمرکز یا با مرتبط کردن ابرداده در مورد فرآیند طراحی با دنباله بیولوژیکی 2، 12. پایگاه های داده نیاز به هماهنگی مرکزی دارند، در مقیاس مستعد مثبت کاذب هستند و ممکن است باعث ایجاد چالش هایی در حفظ حریم خصوصی شوند. در مقابل، ابرداده امضا شده رمزنگاری شده می‌تواند حریم خصوصی را حفظ کند، اما حذف آن آسان است. یک رویکرد جایگزین، واترمارکینگ، امضاها را در خود اشیاء تولید شده توسط هوش مصنوعی تعبیه می کند.

این رویکرد با موفقیت در متون و چند رسانه ای تولید شده توسط هوش مصنوعی اعمال شده و در محصولات مختلف از جمله هوش مصنوعی 13، 14 مولد Google به کار گرفته شده است. واترمارک ها به دلیل نامحسوس بودن، قابلیت تشخیص بالا و حفظ کیفیت را می دهند. آنها جایگزینی برای حفظ حریم خصوصی ارائه می دهند که در آن حذف اطلاعات در مورد منشأ چالش برانگیزتر است و نیازی به هماهنگی مرکزی نیست. علاوه بر این، واترمارکینگ می‌تواند منشأ پیش‌بینی‌های مدل باز را ایجاد کند.

با این حال، مشخص نیست که آیا روش‌های واترمارک موجود به روش‌های بیولوژیکی منتقل می‌شوند که حفظ کیفیت به استفاده مورد نظر پروتئین مربوط می‌شود: برای طراحی پروتئین، این نیاز به حفظ عملکرد بیولوژیکی قابل تأیید تجربی دارد. برای پیش‌بینی ساختاری، شامل حفظ دقت ویژگی‌های ساختاری پیش‌بینی‌شده، حصول اطمینان از اینکه تفسیر محقق و فرضیه‌های عملکرد بیولوژیکی بعدی بدون تغییر باقی می‌مانند. کار همزمان برای واترمارک کردن توالی پروتئین محدود به آزمایش‌های سیلیکو با ساختارهای مونومر نوع وحشی از PDB 3 است.

روش های فعلی منجر به کاهش قابل توجه دقت 15 هنگام واترمارک کردن ساختارهای پروتئینی می شود. در مجموع، اینها نشان می دهد که علامت گذاری با حفظ عملکرد هنوز در دسترس نیست.

ما SynthIDBio را معرفی می‌کنیم، خانواده‌ای از روش‌ها برای جاسازی واترمارک‌های بسیار قابل تشخیص و در عین حال حفظ عملکرد مستقیما در توالی‌ها و ساختارهای بیولوژیکی. SynthIDBio-sequence روشی برای طراحی بایندرهای پروتئینی واترمارک شده است. به دنبال شکل 1a، SynthIDBio-sequence واترمارکینگ را در ProteinMPNN 16 ادغام می کند، که یک مدل طراحی توالی معمولی است که قبل از استفاده از معیارهای ساختاری برای فیلتر کردن طرح ها به کلاسورهای پیش بینی شده 17، 18 در بالای ساختار ستون فقرات اعمال می شود.

ما نشان می‌دهیم که قابلیت تشخیص واترمارک را می‌توان با حداقل کاهش عملکرد سیلیکو تضمین کرد و استحکام واترمارک را برای حذف عمدی بررسی کرد. از طریق اعتبار سنجی آزمایشگاهی، ما بایندرهای پروتئینی کاربردی و دارای واترمارک بیولوژیکی به دست آوردیم: بایندرهای نانومولاری کم برای دامنه اتصال گیرنده SARS-CoV-2 (SC2RBD) و بایندرهای زیر نانومولاری برای فاکتور رشد اندوتلیال عروقی A (VEGF-A) و لیگاند مرگ برنامه ریزی شده 1 (PD-L1).

طراحی آزمایشی ما از ستون فقرات شناخته شده AlphaProteo 17 استفاده کرد که با استفاده از ProteinMPNN با یا بدون دنباله SynthIDBio توالی یابی شدند. در میان اهداف و ستون‌های ستون فقرات، متوجه می‌شویم که واترمارکینگ بر توزیع تمایل اتصال یا نرخ ضربه اتصال تأثیری نمی‌گذارد.

طراحی پروتئین سرتاسر با SynthIDBio-sequence. در طول نمونه‌برداری، بر اساس ستون فقرات تولید شده، از ProteinMPNN با نمونه‌برداری مسابقات SynthID-text برای نمونه‌برداری از دنباله‌های واترمارک شده استفاده می‌کنیم که سپس با استفاده از معیارهای مشتق‌شده از AF3 و آستانه شناسایی بیشتر واترمارک (wm) که به FPR هدف کالیبره می‌شود، فیلتر می‌شوند. در زمان تست، ما از کلید مخفی واترمارک مورد استفاده در هنگام نمونه برداری برای تشخیص واترمارک استفاده می کنیم.

b، ماژول‌های انتشار و اطمینان AF3 (آبی) را برای به دست آوردن ساختار SynthIDBio، که شامل یک واترمارک نامحسوس در هر پیش‌بینی ساختار است، تنظیم دقیق می‌کنیم. ما همچنین یک آشکارساز واترمارک (آبی) را با اضافه کردن یک افت واترمارک اضافی (نارنجی) به تلفات انتشار AF3 آموزش می‌دهیم. فرآیند نمونه برداری با استفاده از ماژول انتشار دقیق بدون تغییر باقی می ماند. در زمان آزمایش، آشکارساز واترمارک را می توان به صورت مستقل برای شناسایی ساختارهای واترمارک استفاده کرد. آشکارساز مخفی باقی می ماند و با کاربران مدل AF3 تنظیم شده به اشتراک گذاشته نمی شود.

ما همچنین ساختار SynthIDBio را ارائه می‌کنیم - مدلی که از AlphaFold 3 (AF3) 19 تنظیم شده است که ساختارهای واترمارک شده را با حفظ دقت ساختاری پیش‌بینی می‌کند. به دنبال شکل 1b، ماژول انتشار AF3 را به دقت تنظیم می کنیم، آن را با یک آشکارساز واترمارک که توسط یک هدف واترمارکی که مستقیما در از دست دادن انتشار AF3 ادغام شده است هدایت می شود. همانطور که در مجموعه ارزیابی AF3 تایید شده است، ساختار SynthIDBio قابلیت تشخیص تقریبا کامل را با تأثیر ناچیز بر دقت جهانی و تأثیر حداقلی بر هندسه پیوند ارائه می دهد.

واترمارک ها در برابر دستکاری های اساسی از جمله تبدیل های صلب و نویز مقاوم هستند. اعتبار سنجی کیفی نشان می دهد که ساختار SynthIDBio با موفقیت اطلاعات واترمارکینگ را در فواصل اتم-اتم پنهان می کند، که از واریانس طبیعی پیش بینی های خود AF3 نسبت به حقیقت زمین قابل تشخیص نیست.

SynthIDBio اثبات فنی مفهومی را ارائه می‌کند که نشان‌دهنده بیولوژیکی حفظ عملکرد و کیفیت امکان‌پذیر است. ما همچنین موارد استفاده بالقوه را مورد بحث قرار می دهیم، از جمله برای امنیت زیستی و یکپارچگی علمی، که در آن انتظار داریم توانایی ردیابی قابل اعتماد منشأ در آینده مهم باشد. با این حال، عملیاتی کردن SynthIDBio برای این برنامه ها علاوه بر هماهنگی و استانداردسازی در سطح صنعت، به نوآوری بیشتری نیاز دارد.

رویکردهای اخیر برای طراحی بایندر پروتئین بر تولید ساختار هدف-شرط و به دنبال آن طراحی توالی با استفاده از ProteinMPNN 16، 17، 18، 20 متکی است (شکل 1a). ProteinMPNN، با رمزگشایی از چپ به راست، توالی‌های مجزا از اسیدهای آمینه را با نمونه‌برداری از توکن‌ها (باقیمانده‌ها) xt در هر مرحله t، از توزیع p (⋅∣ x < t) که مشروط به زمینه قبلی است، تولید می‌کند.

برای واترمارک کردن توالی‌های نمونه‌برداری شده، استراتژی نمونه‌گیری را از متن SynthID، به نام نمونه‌گیری مسابقات، اعمال می‌کنیم که توزیع نمونه p (⋅∣ x < t ) را با استفاده از یک بذر تصادفی r t مشتق شده از زمینه قبلی و یک کلید مخفی watermarking k . به طور خاص، زمینه قبلی می تواند H-gram باشد، یعنی xt-H، …، xt-1، و دانه تصادفی 21، 22 از یک تابع هش f r (xt-H: t-1، k) که به H-gram و k اعمال می شود، مشتق شده است.

توزیع با استفاده از توابع به اصطلاح امتیازدهی (همچنین به نام توابع g، g (xt، r t)) که، مشروط به دانه تصادفی، یک امتیاز باینری به هر نشانه ممکن xt اختصاص می‌دهد، سوگیری می‌کند. نمونه گیری مسابقات به صراحت این مقادیر g را به حداکثر می رساند. با آگاهی از کلید مخفی k، واترمارک را می توان با محاسبه مجدد H-gram و ارزیابی توابع امتیازدهی در زمان آزمون شناسایی کرد. انتظار می‌رود توالی‌های واترمارک‌شده امتیاز بالاتری داشته باشند، به‌طور میانگین در سراسر دنباله، با توالی‌های بدون واترمارک نزدیک به انتظار صفر 0.5 امتیاز کسب کنند.

در نهان نگاری متن، قابلیت تشخیص با توالی های طولانی تر یا آنتروپی بالاتر در توزیع های p (⋅∣ x < t ) 13 بهبود می یابد. مورد دوم به وظیفه بستگی دارد و می تواند با تعدیل دمای نمونه برداری ProteinMPNN تحت تأثیر قرار گیرد.

با استفاده از توابع امتیاز دهی باینری g، که در آن به هر توکن ممکن x t امتیاز 0 یا 1 اختصاص داده می شود، نمونه گیری مسابقات به توکن های نامزد اجازه می دهد تا با یکدیگر رقابت کنند. در ساده‌ترین نمونه یک لایه (L = 1)، از دو نشانه کاندید نمونه‌برداری می‌کنیم و نامزدی را با امتیاز بالاتر انتخاب می‌کنیم (یا نمونه یکنواخت در صورت تساوی). این را می توان به لایه های L > 1 گسترش داد و یک واترمارک قوی تر را به شرح زیر معرفی کرد. در ابتدا، برای لایه l = 1، از 2 L کاندید نمونه برداری می کنیم و اجازه می دهیم جفت ها با استفاده از تابع امتیاز دهی g با کلید k1 با یکدیگر رقابت کنند.

برای لایه l = 2، با استفاده از 2 L-1 کاندید باقی مانده، این فرآیند را با کلید k 2 و غیره تکرار می کنیم. پس از لایه های L، تنها یک نامزد باقی می ماند. در عمل، این می‌تواند به‌عنوان یک تبدیل در بالای لاجیت‌های ProteinMPNN پیاده‌سازی شود، و از نیاز به نمونه‌برداری صریح از توکن‌های کاندید 2 لیتری اجتناب شود. در نتیجه، ما مجموعه ای از امتیازات باینری L را در هر توکن به دست می آوریم. میانگین گرفتن در لایه‌های l و نشانه‌های t میانگین g-value مورد استفاده برای تشخیص را به دست می‌دهد.

استفاده از کلیدهای منحصربه‌فرد k l برای هر لایه، بدون تحریف است، به این معنا که توزیع توکن و توالی در انتظار بیش از کلیدهای kl بدون تغییر باقی می‌مانند (مراجعه‌های 13، 23). در مقابل، تکرار کلیدها به صراحت باعث ایجاد اعوجاج می شود و می تواند قابلیت تشخیص را افزایش دهد. با این حال، تأکید بر این نکته مهم است که این و مفاهیم مشابه از اعوجاج، توزیع‌ها را بر روی نشانه‌ها در نظر می‌گیرند، نه معنایی. کاملا ممکن است که یک واترمارک تحریف کننده هیچ تأثیری بر عملکرد پروتئین نداشته باشد. این فقط از طریق آزمایش تجربی قابل تعیین است.

از آنجایی که دمای ProteinMPNN معمولا برای کارهای طراحی پروتئین پایین است 17، 18 برای کاهش آنتروپی در طول طراحی، ما از واترمارکینگ اعوجاجی برای دماهای پایین استفاده می‌کنیم.

به طور معمول در طراحی پروتئین، یک مدل یک ساختار ستون فقرات طراحی ایجاد می‌کند، که سپس با استفاده از ProteinMPNN برای تولید طرح نهایی، توالی‌بندی می‌شود. این طرح‌ها سپس با استفاده از آستانه‌های معیارهای ساختاری مختلف از یک مدل تاشو پروتئین (به عنوان مثال، AF3)، همانطور که در شکل 1a نشان داده شده است، فیلتر می‌شوند. استفاده از فیلترها بسته به هدف می تواند منجر به نرخ عبور به صورت تک رقمی یا دو رقمی کم شود.

از آنجایی که فیلترها در بالای طرح‌ها اعمال می‌شوند، واترمارک می‌تواند بر توزیع معیارها تأثیر بگذارد و در نتیجه نرخ عبور را کاهش دهد در حالی که فیلترها می‌توانند طرح‌های دارای واترمارک قوی را رها کنند و در نتیجه قابلیت تشخیص واترمارک را کاهش دهند. ما اولی را با ایجاد نامزدهای کافی و دومی را با افزایش قابلیت تشخیص به شرح زیر مقابله می‌کنیم: دمای نمونه‌برداری را از پیش‌فرض 0.1 افزایش می‌دهیم، که همچنین با کاهش تنوع ناشی از واترمارک کردن مقابله می‌کند، یا با استفاده از واترمارک اعوجاجی 24.

برای اولی، دماهای 0.3 و 0.5 را در نظر می گیریم و برای دومی از همان کلید kl در سراسر لایه ها استفاده می کنیم (هر دو با H = 4 و L = 25). برای اعتبار سنجی آزمایشگاهی، ما هر دو واترمارک بدون تحریف و تحریف را با دمای 0.5 و 0.1 انتخاب کردیم. این تنظیمات به این دلیل انتخاب شدند که ارزیابی دماهای بالا (افزایش آنتروپی) و علامت گذاری قوی تر (افزایش اعوجاج) را بر روی میل اتصال را فعال می کردند. ما با طرح های بدون واترمارک در دمای 0.1 مقایسه می کنیم.

علاوه بر این، طرح ها بر اساس یک آستانه g-value مدرج شده برای هر دو تجزیه و تحلیل سیلیکونی و آزمایشگاهی فیلتر می شوند. همانطور که در روش‌ها توضیح داده شد، این آستانه‌ها به یک نرخ مثبت کاذب هدف (FPR) روی مجموعه‌ای از طرح‌های نگه‌داشته‌شده و بدون واترمارک در 23 هدف مختلف و همچنین توالی‌های پروتئین طبیعی از PDB و UniRef50 کالیبره می‌شوند (مراجعه‌های 25، 26). این آستانه یک نرخ مثبت 100٪ واقعی (TPR) را به قیمت فیلتر کردن سخت‌گیرانه‌تر فراهم می‌کند.

بر خلاف طراحی پروتئین، که توالی ها را پیش بینی می کند، مدل های تاشو مانند AF3 (رجوع 19) ساختار مختصات سه بعدی پیوسته اتم ها را پیش بینی می کند. این مدل‌ها معمولا در دسترس عموم قرار می‌گیرند، به این معنی که واترمارکینگ مبتنی بر نمونه‌گیری یا پس‌هک را می‌توان به راحتی دور زد. برای جلوگیری از این امر، رویکرد ما با تنظیم دقیق مدل با استفاده از یک هدف واترمارک اضافی، ابزارهای واترمارک را مستقیما در وزن های مدل تعبیه می کند.

AF3 متشکل از یک تنه است که نمایش‌هایی از توالی‌های پروتئین را ایجاد می‌کند و به دنبال آن یک ماژول انتشار که به طور مکرر ساختارهای تا شده را ایجاد می‌کند و یک سر اطمینان که دقت پیش‌بینی را تخمین می‌زند (شکل 1b) است.

ما روی ماژول انتشار AF3 تمرکز می‌کنیم که، مشروط به ویژگی‌های میانی، مختصات سه بعدی را در تکرارهای T حذف نویز گاوسی سه بعدی ایجاد می‌کند. ماژول انتشار با یک هدف حذف نویز استاندارد، \({{\mathcal{L}}}_{{\rm{تفاوت}}}\) آموزش داده شده است که بر اساس کار قبلی 27 است. برای جاسازی واترمارک، یک شبکه آشکارساز معرفی می‌کنیم و ماژول انتشار را با استفاده از یک تابع از دست دادن ترکیبی تنظیم می‌کنیم. آشکارساز برای تمایز بین ساختارهای دارای واترمارک، بدون واترمارک و ساختارهای حقیقت زمینی از طریق از دست دادن آنتروپی متقاطع باینری، \({{\mathcal{L}}}_{{\rm{wm}}}\) آموزش دیده است.

ما این را با از دست دادن انتشار ترکیب می کنیم تا کل هدف آموزشی را تشکیل دهیم:

که در آن w wm یک ابرپارامتر است که سهم هدف واترمارکینگ را وزن می کند، که آن را w wm = 0.1 قرار می دهیم. از دست دادن سر اعتماد به نفس بدون تغییر باقی می ماند.

معماری آشکارساز از PointNet 28 الهام گرفته شده است. ابتدا با محاسبه ویژگی های هندسی درون باقیمانده مانند فواصل اتم-اتم و زاویه پیچش عمل می کند. سپس این ویژگی ها از طریق چندین لایه پیچش 1 بعدی بر اساس هر باقیمانده پردازش می شوند. نقشه‌های ویژگی به‌دست‌آمده، قبل از اینکه به یک سر خطی نهایی برای طبقه‌بندی منتقل شوند، با ادغام متوسط ​​جمع‌آوری می‌شوند.

برای افزایش استحکام واترمارک در طول تمرین، نویز را به مختصات ساختار پیش‌بینی‌شده قبل از ارسال به آشکارساز تزریق می‌کنیم. این با اضافه کردن نویز یکنواخت نمونه برداری شده از U (-s، s)، با s ∈ {0.1، 0.01، 0.001} Å به دست می آید. ما به طور کلی دریافتیم که حداقل اغتشاش (s ≥ 0.001) برای اطمینان از ماندگاری واترمارک زمانی که ساختارها در قالب‌های فایل رایج ذخیره می‌شوند، مانند فایل اطلاعات کریستالوگرافی (CIF) 29 مورد نیاز است، که معمولا مختصات اتمی را تا سه نقطه اعشار گرد می‌کند.

از آنجایی که فواصل اتم-اتم و زوایای پیچشی که آشکارساز استفاده می‌کند نسبت به تبدیل‌های صلب تغییر نمی‌کند، واترمارک‌های ما برای چنین تبدیل‌هایی با ساخت مقاوم هستند.

برای اینکه واترمارکینگ توالی پروتئین یک مداخله عملی باشد، نباید استفاده مورد نظر از پروتئین را مختل کند. برای تأیید اینکه واترمارکینگ بر عملکرد بایندرهای پروتئینی تأثیر نمی‌گذارد، ما اندازه‌گیری‌های میل ترکیبی اتصال در شرایط آزمایشگاهی بایندرهای غیر واترمارک شده و واترمارکینگ را در برابر سه هدف انجام دادیم: SC2RBD، VEGF-A و PD-L1، به عنوان زیرمجموعه‌ای نماینده یک مطالعه گذشته 17. برای هر هدف، ما از 15 ستون فقرات از طرح های موجود با میل اتصال شناخته شده از کمپین های تاریخی AlphaProteo استفاده کردیم. این ستون فقرات از طریق کاربرد بیشتر ProteinMPNN مجددا تعیین شد.

ما از ستون فقرات کلاسورهای شناخته شده شروع کردیم، به جای اجرای یک طراحی کامل de novo برای افزایش احتمال موفقیت اتصال در هر دنباله و در نتیجه مقدار داده های میل مفید جمع آوری شده. علاوه بر این، استفاده از چندین ستون فقرات در هر هدف، ارزیابی تأثیر توالی و تنوع ساختاری بر عملکرد واترمارک را امکان‌پذیر کرد.

برای هر ستون فقرات، ما 18 طرح را در مجموع آزمایش کردیم: یک دنباله والد (طراحی که قبلا تایید شده مربوط به ستون فقرات انتخاب شده)، پنج دنباله بدون واترمارک. شش از واترمارکینگ بدون اعوجاج با دمای 0.5. و شش از واترمارکینگ اعوجاجی با دمای 0.1. سه توالی در هر هدف به طور تصادفی با یک کنترل منفی (یکی در هر تنظیم مدل) متشکل از یک اتصال دهنده مجدد برای یک هدف جایگزین جایگزین شد.

در مجموع، بدون کنترل، ارزیابی آزمایشگاهی ما شامل 222 توالی بدون واترمارک و 267 دنباله واترمارک شده برای هر تنظیم واترمارکینگ بود. برای جزئیات کامل در مورد تنظیم مشخصات و پروتکل های آزمایشی به روش ها مراجعه کنید.

در شکل 2 ما کمترین تأثیر تنظیم واترمارکینگ را بر روی میل ترکیبی متوسط ​​می‌یابیم که با طیف‌سنجی رزونانس پلاسمون سطحی (SPR) اندازه‌گیری شده و با استفاده از ثابت تفکیک KD بیان می‌شود (شکل 2a)، یا نرخ ضربه طبقه‌بندی شده با میل پیوند (شکل 2b). تفاوت قابل توجهی در سطح جمعیت در پیوندهای اتصال مشتق شده از SPR بین بایندرهای غیر واترمارکینگ و واترمارکینگ (با هر یک از تنظیمات) همانطور که توسط آزمون جمع رتبه‌ای Wilcoxon دو دنباله اندازه‌گیری شد، وجود نداشت.

با این حال، کلاسورهایی که SC2RBD را هدف قرار می‌دهند و با اعوجاج 0.1 واترمارک شده بودند، میانگین KD به طور قابل‌توجهی کمتر از آنهایی که با 0.5 بدون اعوجاج واترمارک شده بودند داشتند. با یک آستانه g-value کالیبره شده برای FPR 0.1٪، ما به طور خودکار یک TPR 100٪ برای تشخیص این طرح ها به دست می آوریم. تفاوت معنی داری در نرخ ضربه برای آستانه میل اتصال KD ≤ 10-7 وجود نداشت. با این حال، تفاوت قابل‌توجهی بین نرخ ضربه‌های بدون تحریف 0.5 و غیر واترمارکینگ در آستانه KD ≤ 10-6 وجود دارد، با کلاسورهای غیر واترمارکینگ نرخ ضربه بالاتری دارند.

همه کنترل های منفی (9 نفر) هیچ اتصال قابل تشخیصی نداشتند. همانطور که در اطلاعات تکمیلی نشان داده شده است، همچنین متوجه شدیم که طرح‌های دارای ترتیب مجدد اغلب نسبت پیوند بهتری نسبت به طرح اصلی دارند. این بهبود در توالی والد در تمایل به روش واترمارک نسبت داده نمی شود، بلکه نتیجه نمونه برداری تکراری و چند دور از ProteinMPNN است. ما بیشتر توالی‌های واترمارکی‌شده را در یک هم‌ترازی توالی چندگانه و ساختار پیش‌بینی‌شده چسباننده واترمارک‌شده در تعامل با VEGF-A نشان می‌دهیم (شکل 2c,d).

همانطور که در هر دو پانل نشان داده شده است، سیگنال واترمارکینگ در سراسر پروتئین، از جمله در تمام انواع ساختارهای ثانویه توزیع می شود. همانطور که با ستون فقرات ثابت شروع کردیم، شکل 2e توزیع های 0.5 بدون اعوجاج و g-value بدون واترمارکی را در همه ستون های ستون فقرات برای PD-L1 نشان می دهد. این نشان می‌دهد که توانایی واترمارک کردن توالی‌ها از طریق یک resequencer توسط ساختار ستون فقرات که ما در ProteinMPNN وارد می‌کنیم محدود شده است. به عنوان مثال، ما توزیع متفاوتی از مقادیر g را بین ستون فقرات 5 و 12 بدون واترمارک نشان می‌دهیم (آزمون مجموع رتبه Wilcoxon دو دنباله).

خواندن متن کامل در نیچربه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

Function-preserving watermarking of AI-generated proteins

Nature, Published online: 30 September 2026; doi:10.1038/s41586-026-10965-y SynthIDBio watermarks AI-generated protein sequences and structures while preserving function, enabling provenance detection and offering a proof-of-concept tool for biosecurity and information integrity.

همه‌ی اخبار فناوری