Publications
Lost in Communication: Uncertainty Propagation in Multi-Agent Systems
Break the Output Geometry for Large Language Model Unlearning
It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models
MEME: Multi-entity & Evolving Memory Evaluation
CLIP Models Generalize Less Than Compositional Benchmarks Suggest
How can embedding models bind concepts?
When Do Diffusion Models learn to Generate Multiple Objects?
MASEval: Extending Multi-Agent Evaluation from Models to Systems
Half-Truths Break Similarity-Based Retrieval
Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models
Universal Algorithm-Implicit Learning
Dynamics Reveals Structure: Challenging the Linear Propagation Assumption
SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?
DISCO: Diversifying Sample Condensation for Efficient Model Evaluation
Dr.LLM: Dynamic Layer Routing for LLMs
CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally
Enhancing Multi-Image Understanding through Delimiter Token Scaling
Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models
LLM generation novelty through the lens of semantic similarity
Diffusion Classifiers Understand Compositionality, but Conditions Apply
On the Rankability of Visual Embeddings
OVS Meets Continual Learning: Towards Sustainable Open-Vocabulary Segmentation
Leaky Thoughts: Large Reasoning Models Are Not Private Thinkers
C-SEO Bench: Does Conversational SEO Work?
Does Data Scaling Lead to Visual Compositional Generalization?
Do Deep Neural Network Solutions Form a Star Domain?
Decoupled Finetuning for Domain Generalizable Semantic Segmentation
Are We Done with Object-Centric Learning?
DiCoTTA: Domain-invariant Learning for Continual Test-time Adaptation
Mitigating Shortcut Learning with Diffusion Counterfactuals and Diverse Ensembles
Playing repeated games with Large Language Models
Benchmarking Uncertainty Disentanglement: Specialized Uncertainties for Specialized Tasks
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
Studying Large Language Model Behaviors Under Realistic Knowledge Conflicts
Towards User-Focused Research in Training Data Attribution for Human-Centered Explainable AI
Scalable Ensemble Diversification for OOD Generalization and Detection
Calibrating Large Language Models Using Their Generations Only
Pretrained Visual Uncertainties
TRAP: Targeted Random Adversarial Prompt Honeypot for Black-Box Identification
A Bayesian Perspective On Training Data Attribution
URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates
ID and OOD Performance Are Sometimes Inversely Correlated on Real-world Datasets
Exploring Practitioner Perspectives On Training Data Attribution Explanations
Neglected Free Lunch -- Learning Image Classifiers Using Annotation Byproducts
Scratching Visual Transformer's Back with Uniform Attention
URL: A Representation Learning Benchmark for Transferable Uncertainty Estimates
Probabilistic Contrastive Learning Recovers the Correct Aleatoric Uncertainty of Ambiguous Inputs
ProPILE: Probing Privacy Leakage in Large Language Models
Dataset Condensation via Efficient Synthetic-Data Parameterization
Weakly Supervised Semantic Segmentation Using Out-of-Distribution Data
Which Shortcut Cues Will DNNs Choose? A Study from the Parameter-Space Perspective