Ìmọ̀ kọ̀ǹpútà
Èdè kan tí kò ní ipa lórí bí o ṣe ń ronú nípa ìṣètò kọ̀ǹpútà kò yẹ kí a mọ̀.
— (1982)
Àwọn developer tó ní ìrírí rò pé AI mú wọn yara, ṣùgbọ́n a wọn pé wọ́n ṣiṣẹ́ lọ́ra síi — finding gidi náà, kì í ṣe verdict lórí AI coding
Nínú randomized controlled trial METR, open-source developers 16 ṣe real tasks 246 lórí codebases tí wọ́n mọ̀ dáadáa, pẹ̀lú early-2025 AI tools tí a gba láàyè fún random half. Wọ́n retí 24% speedup; dípò bẹ́ẹ̀ task time ga ní 19%, lẹ́yìn náà wọ́n ṣì rò pé AI mú wọn yara síi ní ayíká 20%. Perception gap yẹn ni core finding. Ṣùgbọ́n setting náà dín, tools jẹ́ snapshot ti 2025, àwọn olùkọ̀wé sì sọ kedere pé kò fi hàn pé AI kò ran ọ̀pọ̀ developers lọ́wọ́.
Cryptographic proof kan lè hide secret rẹ̀ nípa jíjẹ́ kí missing simulator nira láti prove
Zero-knowledge proofs jẹ́ kí ẹnikan prove statement kan láì reveal witness. Classical theory sọ pé o kò lè ní full zero-knowledge pẹ̀lú one message, no trusted setup àti perfect soundness. Paper Rahul Ilango kò make impossibility yẹn vanish. Ó change target: dípò requiring pé simulator kan wà gidi, ó ask pé proof system tí a yan kò lè efficiently prove pé simulator kò exist. Under major proof-complexity àti cryptographic assumptions, èyí tó láti recover falsifiable, game-based consequences of zero-knowledge property by property. Point náà kì í ṣe plug-in internet primitive. Ó jẹ́ proof-theoretic way láti turn mathematical unprovability into cryptographic cover.
Medical AI lè jẹ́ private on average, ṣùgbọ́n ṣì expose particular patients — underrepresented most of all
Medical-AI model tí a pe ‘privacy-preserving’ sábà rest lórí average number kan. Study yìí argue number yẹn wrong test. Studying membership inference attacks — which reveal whether a specific person's record was in training data and can betray sensitive disease membership — authors measured risk per patient rather than aggregate across seven medical datasets and many models. Pattern: models safe on average can let attacker identify specific individuals almost perfectly (AUC ≥ 0.95); exposed are systematically underrepresented groups; risk worsens as models grow. Authors don't say abandon medical AI — measure privacy per patient, control access, use differential privacy. Core: ‘private on average’ is not privacy guarantee.
Kíkọ́ drawing AI láti wo page tí ó ń yà
Language models tó generate vector graphics máa ń ṣe e blind — wọ́n ń kọ drawing commands láì rí result. Method tuntun kan jẹ́ kí model wo canvas tirẹ̀ bí ó ṣe ń kún, stroke by stroke, twist tó honest sì ni pé fífún un ní ojú nìkan mú nǹkan burú sí i: a gbọ́dọ̀ retrain rẹ̀ láti lo wọn. Payoff ni model tó bá rivals tí a train lórí data tó pọ̀ dé 20× mu tàbí sún díẹ̀ síwájú — result gidi, tó ṣọ́ra lórí benchmark kan, kì í ṣe revolution.
AI agent kan ṣiṣẹ́ gbogbo patient case fúnra rẹ̀ — nínú simulator, lórí past records
MIRA jẹ́ irú medical AI tuntun: dípò kó dá ìbéèrè kan lóhùn, ó ṣiṣẹ́ gbogbo case nínú simulated hospital record — take history, order àti ka tests, dé diagnosis, kọ orders. Lórí 574 retrospective cases láti public database, kọjá eight pre-selected diagnoses, àwọn authors report pé ó ju physicians lọ lórí diagnostic accuracy, decisions rẹ̀ sì largely guideline-concordant àti medication-safe. Ṣùgbọ́n gbogbo qualifier ṣe pàtàkì: ó run nínú sandbox lórí past records, text-only; púpọ̀ edge rẹ̀ wá lórí conditions tí test results wọn clear; ó lo blood tests tó pọ̀ ju doctors lọ; ọ̀pọ̀ outcomes sì jẹ́ scored sí ohun tí original chart record. Genuine advance ni agent tó act across whole workflow — kì í ṣe proof pé machine diagnose dára ju doctor lọ. Àwọn authors fúnra wọn sọ pé generalization, safety àti governance ṣì nílò prospective, real-world studies.
Ṣé àwọn robot “foundation models” ńlá ṣiṣẹ́ dáadáa jù? Ìdáhùn tó ṣọ́ra: díẹ̀ ni béẹ̀ni, ọ̀pọ̀ study kò sì lè sọ ìyàtọ̀
Toyota Research Institute kọ “large behavior models” — robot policies tí a pretrain lórí ~1,700 wákàtí diverse manipulation data — wọ́n sì fi wọn wé from-scratch single-task policies pẹ̀lú blind, randomized, large-sample evaluation (~1,800 real-world, 47,000+ simulation) àti statistics gidi. Lẹ́yìn per-task finetuning, big models ṣe dáadáa ju ní average, nílò tó 3–5× task-specific data tó kéré sí i, wọ́n sì robust sí i nígbà conditions yí padà; performance pọ̀ lọ́wọ́lọ́wọ́ bí pretraining data ṣe pọ̀. Ṣùgbọ́n láìsí finetuning wọn kò consistently ṣẹ́gun single-task models, ọ̀pọ̀ effect kéré tó bẹ́ẹ̀ tí sample ńlá nìkan fi hàn wọn, data-normalisation choice mundane kan sì ní ipa tó pọ̀ ju architecture lọ. Èyí jẹ́ support tó measured fún robot-foundation-model direction — kì í ṣe general-purpose robot, kì í ṣe zero-shot generalist, kì í ṣe “emergent leap” — pẹ̀lú ìkìlọ̀ pé ọ̀pọ̀ robotics research lè ń wọn noise.
Ìdí tí language model fi ń hallucinate — àti ìdí tí ọ̀nà tá a fi ń fún wọn ní máàkì fi ń mú un dúró
Àwọn èké tí a ń pè ní “hallucination” tí model ń sọ pẹ̀lú ìdánilójú kì í ṣe àbùkù àdììtú: àwọn kan jẹ́ èsì statistiki ti ìkọ́ni, wọ́n sì ń dúró nítorí pé benchmark pàtàkì ń san èrè fún ìméfò pẹ̀lú ìdánilójú ju “Mi ò mọ̀” tó jẹ́ òtítọ́ lọ. Case study lórí frontier model mẹ́rin fi hàn pé sísọ ọ̀nà fífúnni ní máàkì nínú prompt (“open rubric”) yí ìwúrí náà padà.