Data Science Seminar

Interpreting Learned Feedback Patterns in Large Language Models

Amir Abdullah

<<< All talks

Interpreting Learned Feedback Patterns in Large Language Models

When Tuesday, November 12, 2024, 12:30 PM – 1:30 PM (MT)
WhereWEB 1230

Abstract

Amir is an active researcher in mechanistic interpretability, opening the blackbox of large language models to reverse engineer the inner workings and analyze internal representations.. In this talk, he will discuss his paper in NeuIPS 2024 on interpreting reward models in language models using sparse autoencoders on internal representations. Further, Amir will introduce followup work studying whether internal representations can be transferred between large language models.

Speaker

Tags: large language models natural language processing


Part of the Data Science Seminar. Something wrong on this page? Edit _data/talks/2024-11-12-amir-abdullah.toml.