ICLR 2025PastLarge language modelsDatasets
ICLR 2025 Workshop on Navigating and Addressing Data Problems for Foundation Models
ICLR 2025 Workshop Data Problems
- Submission deadline
- Feb 8, 2025, 11:59 UTCimported from OpenReview — check the website for extensions
- Submission portal
- OpenReview
- Notes
- Topics were auto-suggested and may be imprecise — edits welcome.
Accepted papers (85)
Fetched from OpenReview (v2) on 2026-06-10.
$f$-SCRUB: Unbounded Machine Unlearning Via $f$-divergences
A Missing Testbed for LLM Pre-Training Membership Inference Attacks
A Versatile Influence Function for Data Attribution with Non-Decomposable Loss
Abg-SciQA: A dataset for Understanding and Resolving Ambiguity in Scientific Questions
ADSO: Adaptive Data Mixture & Scale Optimization. A Multi-Scale Multi-Fidelity Bayesian Optimization Approach.
Adversarial Attacks on Data Attribution
Aioli: A Unified Optimization Framework for Language Model Data Mixing
Approximations to worst-case data dropping: unmasking failure modes
Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs
BenchAgents: Automated Benchmark Creation with Agent Interaction
Beyond ordinary Lipschitz constraints: Differentially Private optimization with TNC
Blind Baselines Beat Membership Inference Attacks for Foundation Models
Building Bridges, Not Walls: Advancing Interpretability by Unifying Feature, Data, and Model Component Attribution
Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning
Common Functional Decompositions Can Mis-attribute Differences in Outcomes Between Populations
Context-Guided Responsible Data Augmentation with Diffusion Models
Context-Parametric Inversion: Why Instruction Finetuning Can Worsen Context Reliance
Contrastive Private Data Synthesis via Weighted Multi-PLM Fusion
D3: A Large Dataset for Training Code Language Models to Act Diff-by-Diff
Data Efficient Pre-training for Language Models: An Empirical Study of Compute Efficiency and Linguistic Competence
Data Mixing Can Induce Phase Transitions in Knowledge Acquisition
Data-Efficient Supervised Fine-Tuning of Language Models Using Optimal Design
Defending LVLMs Against Vision Attacks through Partial-Perception Supervision
Demystifying Long Chain-of-Thought Reasoning in LLMs
Differentially Private Synthetic Data via APIs 3: Using Simulators Instead of Foundation Model
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
Domain-Specific Benchmarking of Vision-Language Models: A Task Augmentation Framework Using Metadata
DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks
Editable Concept Bottleneck Models
Enhancing Interpretability in Generative AI Through Search-Based Data Influence Analysis
Enhancing Multilingual LLM Pretraining with Model-Based Data Selection
Explaining Length Bias in LLM-Based Preference Evaluations
From Fairness to Truthfulness: Rethinking Data Valuation Design
Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?
How much of my dataset did you use? Quantitative Data Usage Inference in Machine Learning
Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities
Improving Multimodal Large Language Models in Low-Resource Language Contexts
Information-theoretic Quantification of Inherent Discrimination Bias in Training Data for Supervised Learning
Investigating Memorization in Video Diffusion Models
KGGen: Text To Knowledge Graph
Language Model Preference Evaluation with Multiple Weak Evaluators
Lightweight Dataset Pruning without Full Training via Example Difficulty and Prediction Uncertainty
LoBAM: LoRA-Based Backdoor Attack on Model Merging
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
MMA: Benchmarking Multi-Modal Large Language Model in Ambiguity Contexts
Model Collapse in the Self-Consuming Chain of Diffusion Finetuning: A Novel Perspective from Quantitative Trait Modeling
Nepotistically Trained Generative Image Models Collapse
NICE: Non-Differentiable Evaluation Metric-Based Data Selection for Instruction Tuning
On the Power of Context-Enhanced Learning in LLMs
OpenRAG: Optimizing RAG End-to-End via In-Context Retrieval Learning
PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation
PiKE: Adaptive Data Mixing for Multi-Task Learning Under Low Gradient Conflicts
Position: What's the next frontier for Data-centric AI? Data Savvy Agents!
Preserving Product Fidelity in Large Scale Image Recontextualization with Diffusion Models
Privacy Attacks on Image AutoRegressive Models
Privacy Auditing for Large Language Models with Natural Identifiers
Proper Dataset Valuation by Pointwise Mutual Information
Query-dependent Prompt Optimization via Multi-Loop Offline Reinforcement Learning
RepFair-QGAN: Alleviating Representation Bias in Quantum Generative Adversarial Networks Using Gradient Clipping
Revisiting Multi-Modal LLM Evaluation
Revisiting Semi-supervised Adversarial Training via Noise-aware Online Robust Distillation
Reward-Augmented Data Enhances Direct Preference Alignment of LLMs
RichSpace: Enriching Text-to-Video Prompt Space via Text Embedding Interpolation
Robust In-Context Learning via Multi-Armed Bandit-Based Partition Selection
Rule-Based Rating and Selection of LLM Training Data
STAMP Your Content: Proving Dataset Membership via Watermarked Rephrasings
SubLIME*: Data Efficient Foundation Model Evaluation across Modalities, Languages and Benchmarks
Synthesizing Physical Backdoor Datasets: An Automated Framework Leveraging Deep Generative Models
Synthesizing Privacy-Preserving Text Data via Finetuning *without* Finetuning Billion-Scale LLMs
Template Matters: Understanding the Role of Instruction Templates in Multimodal Language Model Evaluation and Training
The Delta Learning Hypothesis: Preference Tuning on Weak Data Can Yield Strong Gains
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
The surprising amount of arbitrariness in Shapley-value data valuation
TOWARD EFFICIENT INFLUENCE FUNCTION: DROPOUT AS A COMPRESSION TOOL
Towards Comprehensive Preference Data Collection for Reward Modeling
Towards Human-Guided, Data-Centric LLM Co-Pilots
Towards Internet-Scale Training For Agents
Tracing the Misuse of Personalized Textual Embeddings for Text-to-Image Models
Training and Evaluating Language Models with Template-based Data Generation
TsKAN: A Transparent Architecture for Improving the Interpretability of Multivariate Time Series Forecasting
Understanding Private Learning From Feature Perspective
Unlocking Post-hoc Dataset Inference with Synthetic Data
Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models
Utilizing Language Models For Synthetic Knowledge Graph Generation
Why Does Private Fine-Tuning Resist Differential Privacy Noise? A Representation Learning Perspective