Saayinsii kompiitaraa
Afaan akkaataa ati waa'ee sagantaa itti yaaddu irratti dhiibbaa hin geessisne, beekuun hin malu.
— (1982)
Developers muuxannoo qaban AI waliin saffisaa ta'uu isaanii itti dhaga'ame, garuu safartuun isaan suuta hojjechaa turan — bu'aa dhugaa, verdict AI coding miti
RCT METR developers open-source muuxannoo qaban 16 tasks dhugaa 246 codebases isaan beekan irratti hojjechiise; tasks walakkaa random irratti tools AI jalqaba-2025 eeyyamame. Isaan AI task time naannoo 24% hir'isa jedhanii eegatan; faallaa isaa, completion time 19% ol kaase — fi hojii booda illee AI naannoo 20% saffisiise jedhanii amanan. Perception gap kun core jabaataa dha. Garuu developers 16, setting daangeffame tokko, snapshot jalqaba-2025 qofa: authors AI developers baay'eef hin gargaartu jechuun hin agarsiifne jedhu, fi follow-up 2026 isaanii speedup gara ta'uutti akeeka, caveats waliin.
Cryptographic proof tokko simulator dhabame prove gochuun rakkisaa taasisuun iccitii isaa dhoksuu danda'a
Zero-knowledge proofs namni statement tokko witness osoo hin mul'isin prove akka godhu dandeessisu. Classical theory hiika guutuu keessatti ergaa tokko, trusted setup malee fi perfect soundness waliin kana qabaachuun hin danda'amu jedha. Paper Rahul Ilango impossibility sana hin balleessu. Target jijjiira: simulator dhugumaan jiraachuu gaafachuu mannaa, proof system filatame tokko simulator akka hin jirre efficiently prove gochuu akka hin dandeenye gaafata. Assumptions guguddoo proof-complexity fi cryptography jalatti, kun consequences falsifiable, game-based zero-knowledge property tokkoon tokkoon isaanii deebisuuf gaha. Point isaa internet primitive plug-in tokko miti. Mathematical unprovability cryptographic cover gochuuf karaa proof-theoretic dha.
Medical AI average irratti private ta'ee illee patients specific expose gochuu danda'a — keessumaa underrepresented
Medical-AI model 'privacy-preserving' jedhu yeroo baay'ee average number tokko irratti hirkata. Study kun wrong test jedha. Membership inference attacks — record person specific training data keessa ture reveal godhu — per patient safaruun, seven medical datasets (imaging, ECG, EHR) fi models hedduu keessatti, average safe fakkaatu illee individuals tokko tokko almost perfectly identify ta'uu (AUC ≥0.95), exposed systematic underrepresented groups, problem model growth waliin worse ta'uu argan. Authors abandon medical AI hin jedhu — privacy per patient measure, access control, differential privacy jedhu. Core: 'private on average' privacy guarantee miti, already least-protected patients irratti fail godha.
Drawing AI page isaa akka ilaalu barsiisuu
Vector graphics generate godhan language models blind ta'anii drawing commands barreessu, result hin argan. Method haaraan model canvas ofii stroke-by-stroke akka ilaalu godha; honest twist: eyes kennuun qofti worse godha — visual feedback fayyadamuuf retrain gochuun barbaachisa. Payoff model rivals hanga 20× more data irratti trained match yookaan xiqqoo caalu dha — benchmark tokko irratti result real/careful, revolution miti.
AI agent tokko patient cases guutuu ofumaan hojjete — simulator keessatti, past records irratti
MIRA medical AI gosa haaraa: gaaffii tokko deebisuu irra simulated hospital record keessatti case guutuu hojjeta — history, tests order/read, diagnosis, orders. Public database retrospective cases 574, eight pre-selected diagnoses irratti authors diagnostic accuracy physicians caale fi largely guideline-concordant medication-safe decisions godhe jedhu. Garuu qualifier hundi matter: sandbox past records, text only; edge baay'een clear tests conditions irraa; blood tests doctors caalaa naannoo dachaa fayyadame; outcomes tokko tokko original chart against scored. Advance dhugaan agent whole workflow keessatti action fudhatu dha — machine doctor caalaa diagnose godha proof miti. Authors generalization, safety, governance prospective real-world studies barbaadu jedhu.
Robot 'foundation models' guguddoon dhugumaan caalaatti hojjetu? Deebii of-eeggannoo: xiqqoo eeyyee — studies hedduun garuu adda baasuu hin danda'an
Toyota Research Institute 'large behavior models' — robot policies diverse manipulation data sa'aatii ~1,700 irratti pretrained — from-scratch single-task policies waliin unusually rigorous blind, randomized, large-sample trials (~1,800 real-world, 47,000+ simulation) keessatti test godhe. Per-task finetuning booda big models average irratti caalan, task-specific data ~3–5× xiqqaa barbaadan, distribution shift jalatti robust caalaa turan; performance pretraining data waliin smooth ta'een ol ka'e. Garuu finetuning malee single-task models consistently hin caalle, effects hedduun sample guddaa malee hin mul'anne, data-normalisation filannoo idilee architecture caalaa impact qabaate. Kun robot-foundation-model direction'f measured support dha — general-purpose robot miti, zero-shot generalist miti, 'emergent leap' miti — fi robotics hedduun statistical noise safaraa jiraachuu mala jechuun akeekkachiisa.
Moodeelonni afaanii maaliif hallucinate godhu — akkaataan qabxii itti kenninus maaliif akkasuma akka turu godha
Sobni ofitti amanamuun himamu kan “hallucination” jennu dogoggora iccitii miti: tokko tokko bu'aa statistiksii leenjii ti; benchmarks baramaan tilmaama ofitti amanamu “hin beeku” amanamaa caalaa waan badhaasaniif hafan. Case study frontier models afur irratti, qabxii prompt keessa ibsuun (“open rubrics”) kaka'umsa sana akka garagalchu agarsiisa.