Skip to content
Scalable Trustworthy AI Scalable Trustworthy AI

Publications

2026

Lost in Communication: Uncertainty Propagation in Multi-Agent Systems

ICML 2026 AgenticUQ Workshop

Break the Output Geometry for Large Language Model Unlearning

ICML 2026 MemFM Workshop

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

arXiv arXivPDF

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

MEME: Multi-entity & Evolving Memory Evaluation

CLIP Models Generalize Less Than Compositional Benchmarks Suggest

ICML 2026 CompLearn Workshop PDF

How can embedding models bind concepts?

ICML Spotlight arXivPDF

When Do Diffusion Models learn to Generate Multiple Objects?

MASEval: Extending Multi-Agent Evaluation from Models to Systems

ACL System Demo arXivPDFCode

Half-Truths Break Similarity-Based Retrieval

Universal Algorithm-Implicit Learning

Dynamics Reveals Structure: Challenging the Linear Propagation Assumption

ICML Spotlight arXivPDF

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

DISCO: Diversifying Sample Condensation for Efficient Model Evaluation

Dr.LLM: Dynamic Layer Routing for LLMs

Enhancing Multi-Image Understanding through Delimiter Token Scaling

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

2025

LLM generation novelty through the lens of semantic similarity

ICML 2026 FoGen Workshop arXivPDFDataset

Diffusion Classifiers Understand Compositionality, but Conditions Apply

NeurIPS D&B arXivPDFCode

On the Rankability of Visual Embeddings

NeurIPS arXivPDFCode

OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation

NeurIPS arXivPDF

Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers

C-SEO Bench: Does Conversational SEO Work?

Do Deep Neural Network Solutions Form a Star Domain?

Decoupled Finetuning for Domain Generalizable Semantic Segmentation

ICLR PDF

Are We Done with Object-Centric Learning?

DiCoTTA: Domain-invariant Learning for Continual Test-time Adaptation

arXiv arXivPDF

Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles

SCSL @ ICLR arXivPDF

Playing repeated games with Large Language Models

Nature Human Behaviour arXivPDF
2024

Benchmarking Uncertainty Disentanglement: Specialized Uncertainties for Specialized Tasks

NeurIPS D&B (Spotlight) arXivPDFCode

Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models

NAACL Findings arXivPDF

Studying Large Language Model Behaviors Under Realistic Knowledge Conflicts

Towards User-Focused Research in Training Data Attribution for Human-Centered Explainable AI

arXiv arXivPDF

Scalable Ensemble Diversification for OOD Generalization and Detection

Calibrating Large Language Models Using Their Generations Only

Pretrained Visual Uncertainties

TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification

ACL Findings arXivPDF
2023

A Bayesian Perspective On Training Data Attribution

NeurIPS arXivPDFCode

URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates

NeurIPS D&B arXivPDFCode

ID and OOD Performance Are Sometimes Inversely Correlated on Real-world Datasets

NeurIPS arXivPDF

Exploring Practitioner Perspectives On Training Data Attribution Explanations

NeurIPS XAI in Action Workshop arXivPDF

Neglected Free Lunch -- Learning Image Classifiers Using Annotation Byproducts

Trustworthy Machine Learning

Scratching Visual Transformer's Back with Uniform Attention

URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates

UAI-EAI Best Student Paper arXivPDFCode

ProPILE: Probing Privacy Leakage in Large Language Models

NeurIPS Spotlight arXivPDF
2022

Dataset Condensation via Efficient Synthetic-Data Parameterization

Weakly Supervised Semantic Segmentation Using Out-of-Distribution Data

Which Shortcut Cues Will DNNs Choose? A Study from the Parameter-Space Perspective

Google Scholar