RSS

Joshua Fonseca Rivera

Karma: 108

Trying to make AI go well for everyone.

X: @joshycodes

Item Re­sponse The­ory for AI Safety

7 Aug 2026 16:59 UTC
19 points
2 comments7 min readLW link

What Hap­pens When a Model Thinks It Is AGI?

23 Apr 2026 22:35 UTC
64 points
5 comments5 min readLW link

Steer­ing Aware­ness: Models Can Be Trained to De­tect Ac­ti­va­tion Steering

12 Mar 2026 23:34 UTC
20 points
0 comments6 min readLW link

A Sim­ple Method for Ac­cel­er­at­ing Grokking

Joshua Fonseca Rivera24 Jan 2026 3:19 UTC
14 points
1 comment3 min readLW link

Train­ing Models to De­tect Ac­ti­va­tion Steer­ing: Re­sults and Implications

Joshua Fonseca Rivera26 Nov 2025 14:51 UTC
12 points
0 comments4 min readLW link