The Robots Will Insider Trade
Abstract to a paper titled, “Technical Report: Large Language Models can Strategically Deceive their Users when Put Under Pressure” by Jeremy Scheurer, Mikita Balesni and Marius Hobbhahn of Apollo Research: We demonstrate a situation in which Large Language Models, trained to be helpful, harmless, and honest, can display misaligned behavior Read more…






