Research

Making language models safer to trust.

My work examines unwanted memorization, privacy leakage, targeted forgetting, and adversarial behavior in large language models.


Focus areas

Three connected problems

I approach trustworthy AI across the model lifecycle: understanding what models retain, measuring how that information can leak, and developing safer mitigation strategies.

01 / FORGET

Machine Unlearning

Methods for selectively removing unwanted information from language models while preserving coherence and general utility.

02 / MEASURE

Privacy & Memorization

Membership inference attacks and model behavior analysis for understanding when training data can be detected or exposed.

03 / PROTECT

Safety & Alignment

Adversarial in-context learning, jailbreaking, poisoning, and safety alignment in large language and reasoning models.

Research questions

From model behavior to dependable safeguards.

The goal is to develop AI systems whose privacy and safety properties are measurable, controllable, and robust.

  • How can a model forget targeted knowledge without losing broad utility?
  • What model signals reveal memorization or training-set membership?
  • How do adversarial contexts and post-training affect safety behavior?
  • How can mitigation strategies remain robust across model behaviors?

Experience

Research & teaching

  1. Aug 2025–Present

    Graduate Research Assistant

    Wayne State University

    Research on LLM safety, privacy risks, unlearning, membership inference, and model behavior analysis.

  2. Aug 2024–Aug 2025

    Graduate Teaching Assistant

    Wayne State University

    Introduction to Machine Learning, Graduate Seminar, and Operating Systems.

  3. Aug 2023–Aug 2024

    Graduate Research Assistant

    Wayne State University

    Research related to large language models and AI safety.

  4. 2021–2022

    Teaching Assistant

    University of Tehran

    Graph Theory.

Methods & tools

Technical background

Machine learning

  • LLM fine-tuning
  • Safety evaluation
  • Unlearning
  • Reinforcement learning

Frameworks & libraries

  • PyTorch
  • TensorFlow
  • Hugging Face
  • Transformers
  • Scikit-learn
  • NumPy
  • Pandas
  • NLTK

Programming

  • Python
  • C++
  • Assembly
  • Dart
  • Flutter