Data Science Seminar
Interpreting Learned Feedback Patterns in Large Language Models
Amir Abdullah
Interpreting Learned Feedback Patterns in Large Language Models
| When | Tuesday, November 12, 2024, 12:30 PM – 1:30 PM (MT) |
|---|---|
| Where | WEB 1230 |
Abstract
Amir is an active researcher in mechanistic interpretability, opening the blackbox of large language models to reverse engineer the inner workings and analyze internal representations.. In this talk, he will discuss his paper in NeuIPS 2024 on interpreting reward models in language models using sparse autoencoders on internal representations. Further, Amir will introduce followup work studying whether internal representations can be transferred between large language models.
Speaker
Tags: large language models natural language processing
Part of the Data Science Seminar. Something wrong on this page? Edit _data/talks/2024-11-12-amir-abdullah.toml.