Publications

Papers and preprints

Verified research output spanning model compression, distributed optimization, quantization, and sparse adaptation. Entries are shown newest first; links appear only when a source is available.

Filter by publication type

Filter by topic

2026
PreprintarXiv

Demystifying Pipeline Parallelism: First Theory for PipeDream

Ivan Ilin, Peter Richtárik

A theoretical analysis of convergence and delayed updates in randomized PipeDream-style pipeline parallelism.

2026
PreprintarXiv

Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method

Abdurakhmon Sadiev, Artavazd Maranjyan, Ivan Ilin, Peter Richtárik

An asynchronous optimization method built around linear minimization oracles and momentum.

2026
PreprintarXiv

Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning

Ivan Ilin, Philip Zmushko, Peter Richtárik

A study connecting activation-aware pruning with sparse fine-tuning for language-model adaptation.

2025
Conference paperNAACL 2025Published

HIGGS: Pushing the Limits of Large Language Model Quantization via the Linearity Theorem

Vladimir Malinovskii, Andrei Panferov, Ivan Ilin, Han Guo, Peter Richtárik, Dan Alistarh

Research on language-model quantization built around a linearity theorem.

2025
PreprintarXiv

Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression

Ivan Ilin, Peter Richtárik

A block-wise pruning method that removes multiple weights jointly and coordinates their compensation using second-order information.

2024
ThesisKAUSTPublished

Efficient and Fast Pruning of Large Language Models

Ivan Ilin

A master's thesis on efficient pruning methods for large language models.

Paper
2024
Conference paperNeurIPS 2024Published

PV-Tuning: Beyond Straight-Through Estimation for Extreme LLM Compression

Vladimir Malinovskii, Denis Mazur, Ivan Ilin, Denis Kuznedelev, Konstantin Burlachenko, Kai Yi, Dan Alistarh, Peter Richtárik

Research on optimization beyond straight-through estimation for extreme language-model compression.

2024
Conference paperNeurIPS 2024Published

Shadowheart SGD: Distributed Asynchronous SGD with Optimal Time Complexity Under Arbitrary Computation and Communication Heterogeneity

Alexander Tyurin, Marta Pozzi, Ivan Ilin, Peter Richtárik

A distributed asynchronous SGD method analyzed under heterogeneous computation and communication.

2023
Workshop paperDistributedML 2023Published

Kimad: Adaptive Gradient Compression with Bandwidth Awareness

Jihao Xin, Ivan Ilin, Shunkang Zhang, Marco Canini, Peter Richtárik

An adaptive gradient-compression method designed with network bandwidth awareness.

No publications match both filters.