RSS

Fabien Roger

Karma: 8,658

I am working on empirical AI safety.

Anonymous feedback form.

Over­think­ing: Am­plify­ing rea­son­ing weights makes mod­els re­veal their secrets

9 Aug 2026 22:06 UTC
17 points
0 comments7 min readLW link
(arxiv.org)

(Mis)gen­er­al­iza­tion of Helpful-Only Fine-tuning

4 Jun 2026 18:40 UTC
61 points
8 comments11 min readLW link