Publications

Selected scholarly work.

Publications and manuscripts on large language model unlearning, privacy, security, and safety alignment.


  1. 2026

    Attention Smoothing Is All You Need For Unlearning

    Zare Zade, S., Zhou, X., Liu, S., Zhu, D.

    International Conference on Learning Representations (ICLR), 2026

    Conference
  2. 2026

    Not All Tokens Are Meant to Be Forgotten

    Zhou, X., Qiang, Y., Zare Zade, S., Zytko, D., Khanduri, P., Zhu, D.

    AAAI Conference on Artificial Intelligence (AAAI), 2026

    Conference
  3. 2026

    Hijacking Large Language Models via Adversarial In-Context Learning

    Zhou, X., Qiang, Y., Zare Zade, S., Khanduri, P., Zhu, D.

    European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD), 2026

    Conference
  4. 2025

    Automatic Calibration for Membership Inference Attack on Large Language Models

    Zare Zade, S., Qiang, Y., Zhou, X., Zhu, H., Roshani, M. A., Khanduri, P., Zhu, D.

    European Conference on Artificial Intelligence (ECAI), 2025

    Conference
  5. 2026

    Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models

    Zhou, X., Zare Zade, S., Sultan, R. I., Kotov, A., Zhu, D.

    Under review at the Conference on Neural Information Processing Systems (NeurIPS), 2026

    Under review
  6. 2027

    BOS Summary: The First Token Matters

    Zhu, H., Zare Zade, S., Sultan, R. I., Pan, D., Zhu, D.

    Under review at the AAAI Conference on Artificial Intelligence (AAAI), 2027

    Under review
  7. 2027

    Alignment of LRMs via Counter-Aligned Few-Shot Conversation Exposure

    Zhou, X., Zare Zade, S., Zhu, D.

    Under review at the AAAI Conference on Artificial Intelligence (AAAI), 2027

    Under review
  8. 2026

    Learning to Poison Large Language Models for Downstream Manipulation

    Zhou, X., Qiang, Y., Zare Zade, S., Roshani, M. A., Khanduri, P., Zytko, D., Zhu, D.

    Under review at IEEE BigData, 2026.

    Under review

For citation records and updates, visit Google Scholar.