علوم رایانه

زبانی که بر شیوه فکر کردنت درباره برنامه‌نویسی اثر نگذارد، ارزش آموختن ندارد.

Alan Perlis (1982)

مهندسی نرم‌افزار

17 July 2026

توسعه‌دهندگان باتجربه با AI احساس می‌کردند سریع‌ترند، اما اندازه‌گیری نشان داد کندتر کار می‌کنند — یافتهٔ واقعی همین است، نه حکم نهایی دربارهٔ کدنویسی با AI

در یک کارآزمایی تصادفی کنترل‌شده از METR، شانزده توسعه‌دهندهٔ باتجربهٔ متن‌باز ۲۴۶ کار واقعی را روی کدبیس‌هایی که خوب می‌شناختند انجام دادند و در نیمی تصادفی از کارها ابزارهای AI اوایل ۲۰۲۵ (Cursor Pro با Claude 3.5/3.7 Sonnet) مجاز بود. آن‌ها انتظار داشتند AI زمان کار را حدود ۲۴٪ کم کند؛ در عوض زمان تکمیل ۱۹٪ بیشتر شد — و پس از آن هنوز باور داشتند AI حدود ۲۰٪ سریع‌ترشان کرده است. همین شکاف ادراک هستهٔ محکم مطالعه است. اما این فقط شانزده توسعه‌دهنده، یک محیط محدود و عکس فوری اوایل ۲۰۲۵ است؛ نویسندگان صریح‌اند که نتیجه نشان نمی‌دهد AI به بیشتر توسعه‌دهندگان کمک نمی‌کند و پیگیری ۲۰۲۶ خودشان نیز، با احتیاط‌های خودش، به سمت افزایش سرعت متمایل است.

رمزنگاری

9 July 2026

یک اثبات رمزنگارانه می‌تواند راز را با دشوار کردن اثباتِ نبود شبیه‌ساز پنهان کند

اثبات‌های دانش صفر اجازه می‌دهند کسی یک گزاره را بدون آشکار کردن شاهد اثبات کند. نظریهٔ کلاسیک می‌گوید در معنای کامل نمی‌توان هم‌زمان یک پیام، بدون راه‌اندازی مورد اعتماد و درستی کامل داشت. مقالهٔ Rahul Ilango این عدم امکان را ناپدید نمی‌کند. هدف را عوض می‌کند: به‌جای اینکه شبیه‌ساز واقعاً وجود داشته باشد، کافی است سامانهٔ اثبات انتخاب‌شده نتواند به‌طور کارآمد ثابت کند که شبیه‌ساز وجود ندارد. تحت مفروضات مهم در پیچیدگی اثبات و رمزنگاری، این برای بازیابی پیامدهای ابطال‌پذیر و مبتنی بر بازیِ دانش صفر، ویژگی‌به‌ویژگی، کافی است. نکته یک primitive آماده برای اینترنت نیست؛ راهی نظریه‌اثباتی برای تبدیل اثبات‌ناپذیری ریاضی به پوشش رمزنگارانه است.

AI پزشکی

5 July 2026

یک AI پزشکی می‌تواند در میانگین خصوصی باشد و باز هم بعضی بیماران را افشا کند — بیش از همه کم‌نماینده‌ها را

مدل AI پزشکی که «حافظ حریم خصوصی» نامیده می‌شود معمولاً بر یک عدد میانگین تکیه دارد. این مطالعه می‌گوید آزمون اشتباه همین است. با بررسی membership inference attack — که می‌سنجد آیا رکورد یک فرد مشخص در دادهٔ آموزش بوده و بنابراین می‌تواند حتی بدون افشای خود پرونده اطلاعات بیماری را لو دهد — نویسندگان خطر را به‌جای aggregate برای هر بیمار، در هفت dataset پزشکی و مدل‌های متعدد اندازه گرفتند. الگو: مدل‌هایی که در میانگین امن‌اند می‌توانند افراد خاصی را تقریباً بی‌نقص قابل‌شناسایی کنند (AUC ≥ 0.95)؛ افراد در معرض به‌طور نظام‌مند از گروه‌های کم‌نماینده‌اند؛ و خطر با بزرگ شدن مدل افزایش می‌یابد. توصیه ترک AI پزشکی نیست، بلکه سنجش حریم خصوصی در سطح بیمار، کنترل دسترسی و differential privacy است. هستهٔ ناراحت‌کننده: «در میانگین خصوصی» تضمین حریم خصوصی نیست و برای همان بیمارانی شکست می‌خورد که از قبل کمتر محافظت شده‌اند.

هوش مصنوعی مولد

5 July 2026

به AI یاد بده هنگام رسم به کار خودش نگاه کند — اما فقط «چشم بازکردن» کافی نیست

مدل‌های تولید SVG معمولاً تمام کد رسم را یک‌باره و بدون دیدن نتیجه می‌نویسند. Render-in-the-Loop پس از هر گام تصویر نیمه‌تمام را رندر می‌کند و به مدل بازمی‌گرداند. نکتهٔ جالب این است که بازخورد بصری ساده روی مدل آماده کیفیت را بدتر کرد؛ سود فقط پس از بازآموزی مرحله‌به‌مرحله و افزودن Render-and-Verify ظاهر شد. مدل 8B حاصل، با حدود ۸۵۰ هزار نمونه، روی MMSVGBench با رقبایی که تا ۲۰ برابر داده دیده‌اند برابری یا اندکی برتری دارد — آن هم با حاشیه‌های کوچک روی سنجه‌های جانشین. درس اصلی: دیدن کار خود قابلیتی نیست که خودبه‌خود مفید شود؛ باید برای استفاده از آن آموزش دید.

هوش مصنوعی پزشکی

5 July 2026

MIRA یک پروندهٔ پزشکی کامل را در sandbox اجرا کرد و در benchmark از پزشکان جلو زد — اما این هنوز کلینیک نیست

MIRA، عاملی خودمختار مبتنی بر GPT-4o و o1، در محیط شبیه‌سازی‌شدهٔ پروندهٔ سلامت الکترونیک می‌تواند شرح‌حال بگیرد، آزمایش و تصویربرداری درخواست کند، نتایج را تفسیر کند، تشخیص بسازد و دستور درمان بنویسد. روی ۵۷۴ پروندهٔ گذشته‌نگر MIMIC-IV در هشت تشخیص، دقت کلی ۸۸٫۹٪ داشت و در زیرمجموعه‌ای از ۳۱۱ پرونده به ۸۷٫۸٪ رسید، در برابر ۷۸٫۱٪ برای پزشکان دارای بورد تخصصی. اما این شبیه‌سازی فقط متنی و روی پرونده‌های گذشته بود؛ MIRA حدود ۵۱٪ از موارد آزمایشگاهی موجود را به کار گرفت، در برابر ۲۸٪ برای پزشکان، و بخش بزرگی از برتری در بیماری‌هایی بود که آزمون‌های تشخیصی روشنی داشتند. این نتیجه توانایی در یک محیط بسته را نشان می‌دهد، نه پزشک خودمختار برای بیماران واقعی.

رباتیک

25 June 2026

آیا «مدل‌های بنیادین» بزرگِ رباتی واقعاً بهتر کار می‌کنند؟ پاسخ دقیق: تا حدی بله، و بیشتر پژوهش‌ها اصلاً توان تشخیصش را ندارند

Toyota Research Institute «مدل‌های رفتاری بزرگ» را — سیاست‌های رباتی پیش‌آموزش‌دیده روی حدود ۱۷۰۰ ساعت دادهٔ متنوع دستکاری — با سخت‌گیری کم‌سابقه در برابر سیاست‌های تک‌کارِ آموزش‌دیده از صفر آزمود: آزمایش‌های کور، تصادفی و پُرنمونه (حدود ۱۸۰۰ اجرای واقعی و بیش از ۴۷٬۰۰۰ اجرای شبیه‌سازی) همراه با آمار واقعی. پس از ریزتنظیم برای هر کار، مدل‌های بزرگ به‌طور میانگین بهتر بودند، تقریباً ۳ تا ۵ برابر دادهٔ اختصاصی کمتری می‌خواستند و هنگام تغییر شرایط مقاوم‌تر بودند؛ عملکرد نیز با دادهٔ پیش‌آموزش بیشتر به‌صورت هموار بالا رفت. اما بدون ریزتنظیم به‌طور پایدار از مدل‌های تک‌کار بهتر نبودند، چند اثر آن‌قدر کوچک بود که فقط نمونه‌های بزرگ آشکارشان کرد، و یک انتخاب معمولی در نرمال‌سازی داده از معماری مهم‌تر بود. این پشتوانه‌ای اندازه‌گیری‌شده برای مسیر مدل‌های بنیادین رباتی است — نه ربات همه‌منظوره، نه همه‌کارهٔ zero-shot و نه «جهش ظهور‌یافته» — و هشداری جدی که شاید بخش بزرگی از رباتیک در حال اندازه‌گیری نویز باشد.

هوش مصنوعی

21 June 2026

چرا مدل‌های زبانی توهم می‌زنند — و چرا شیوهٔ نمره‌دهی ما آن را نگه می‌دارد

دروغ‌های مطمئنی که «توهم» می‌نامیم نقصی رازآلود نیستند: بخشی از آن‌ها محصول جانبی آماری آموزش‌اند، و باقی می‌مانند چون benchmarkهای اصلی حدس مطمئن را از «نمی‌دانم» صادقانه بیشتر پاداش می‌دهند. یک مطالعهٔ موردی روی چهار مدل مرزی نشان می‌دهد که بیان قواعد نمره‌دهی در prompt («open rubrics») این انگیزه را وارونه می‌کند.