Agent Researcher & Engineer

Qianli Ma

Ph.D. student in Artificial Intelligence, Shanghai Jiao Tong University

LLM post-training, work agents, and code agents.

Qianli Ma
Do something interesting.
01

About me

I am a Ph.D. student at Shanghai Jiao Tong University, advised by Prof. Zhipeng Zhang. Previously, I received my master's degree in Computer Science from SJTU, advised by Prof. Li Niu and Prof. Linfeng Zhang, and my bachelor's degree in Instrument Science and Control Technology from Southeast University.

My research interests lie in LLM post-training, work agents, and code agents. My previous work spans collaborative work agents, model merging, and the generation and evaluation of visual content.

I'm always happy to discuss LLM post-training, work agents, and code agents. Let's get in touch.

02

News

Notes & milestones
  • Recognized as a Top Reviewer for NeurIPS 2026
  • Three papers accepted by NeurIPS 2026
  • One paper accepted by CoRL 2026
  • One paper accepted by EMNLP 2026
  • One paper accepted by ECCV 2026
  • Recognized as a Gold Reviewer for ICML 2026
  • One paper accepted by ICML 2026
  • Three papers accepted by ACL 2026 (2 main conference and 1 findings paper)
  • Two papers accepted by CVPR 2026
  • One paper accepted by IEEE TPAMI 2025
  • We release AutoPage , a multi-agent system that turns your academic paper into a high-quality project page.
  • We achieved top 3 ranking in IROS 2025 RoboSense Challenge, Driving with Language Track.
  • One paper accepted by ACL 2025 main conference
  • Completed my Master's degree! Thanks to all my friends and advisors
  • Two papers accepted by CVPR 2025!
  • Started internship at Shanghai AI Laboratory again.
  • We release VBench-Long , a tool for evaluating long video generation models.
  • Started internship at Shanghai AI Laboratory.
  • Started internship at Baidu.
03

Publications

Research, in a few directions

From diffusion models to LLM agents, I explore how AI can support human creativity and productivity.

Work Agents

Human–agent collaboration for research, writing, and scientific workflows.

LLM Post-training & Merging

Adapting and merging language models for better capability, safety, and utility.

Visual Generative Models

Diffusion models, efficient sampling, and image and video generation.

Benchmarks & Surveys

Benchmarks for models and agents, and surveys of emerging research directions.

Embodied Agents

Agents that perceive, reason, and act in physical environments.

* Equal contribution   ·   † Corresponding author   ·   § Project leader

18 publications
Preprint · 2026
OmniPresent: Generating Coherent Presentation Suites from Scientific Papers — overviewOmniPresent: Generating Coherent Presentation Suites from Scientific Papers — method or evaluation figure
Work Agents

OmniPresent: Generating Coherent Presentation Suites from Scientific Papers

Qianli Ma*, Jipeng Xiao*, Siyu Wang*, Zhiheng Tian, Wangyu Feng, Shibo Wang, Chang Guo, Shuochen Chang, Qingyang Liu, Zhipeng Zhang†

A multi-agent framework for coherent posters, slides, videos, and project pages, with cross-artifact verification and the OmniPreBench evaluation suite.

EMNLP 2026 · Main
Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training — overviewNot All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training — method or evaluation figure
LLM Post-training & Merging

Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training

Yuanhao Yue*, Qianli Ma*, Chengyu Wang†, Haoting Wang, Lei Shen, Jun Huang

An exploration potential score identifies less informative training prompts and guides teacher-generated scaffolds for adaptive multimodal RL post-training.

CoRL 2026
RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents — overview
Embodied AgentsBenchmarks & Surveys

RoboFollow: Unveiling the Instruction Following Mirage in Embodied Agents

Chang Guo, Yukun Xie, Bohan Tan, Zheng Chang, Zhaokai Yin, Qianli Ma, Yingqiao Wang, Chao Liang, Zhipeng Zhang†

A diagnostic benchmark that separates language understanding from motor execution to test whether embodied agents truly follow instructions.

Preprint · 2026
Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression — overviewWhy Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression — method or evaluation figure
LLM Post-training & Merging

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

Shuochen Chang*, Qingyang Liu*, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li†, Li Niu†

DLR compresses rendered reasoning traces into interpretable discrete latent tokens, supporting autoregressive training, supervised finetuning, and reinforcement learning.

ECCV 2026
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning — overviewReliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning — method or evaluation figure
LLM Post-training & Merging

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

Haomin Wang*, Qi Wei*, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang†

CTRL-S combines chain-of-thought SVG generation with multi-task, multi-reward reinforcement learning for structured and visually faithful vector graphics.

ACL 2026 · Main
Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention — overview
LLM Post-training & Merging

Unlocking the Black Box of Latent Reasoning: An Interpretability-Guided Approach to Intervention

Shuochen Chang*, Tong Bai*, Xiaofeng Zhang, Qianli Ma, Qingyang Liu, Zhaohe Liao, Yibo Miao, Li Niu†

Structural, causal, and geometric probes of latent reasoning guide training-free interventions that improve reasoning accuracy without parameter updates.

CVPR 2026
Group Editing: Edit Multiple Images in One Go — overviewGroup Editing: Edit Multiple Images in One Go — method or evaluation figure
Visual Generative Models

Group Editing: Edit Multiple Images in One Go

Yue Ma*, Xinyu Wang*, Qianli Ma§, Qinghe Wang†, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu†, Qifeng Chen

Consistent edits across related images by combining geometric correspondences with video generation priors, evaluated on the GroupEditBench benchmark.

ICML 2026
A Very Big Video Reasoning Suite — overview
Visual Generative ModelsBenchmarks & Surveys

A Very Big Video Reasoning Suite

Maijunxian Wang*, Ruisi Wang*, Juyi Lin*, Ran Ji*, …, Qianli Ma, …, Zhongang Cai†, Hokin Deng†

All 56 authors

Maijunxian Wang*, Ruisi Wang*, Juyi Lin*, Ran Ji*, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai†, Hokin Deng†

A large-scale suite for video reasoning, pairing diverse training tasks with verifiable evaluation and a systematic study of reasoning generalization.

ACL 2026 · Main
Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance — overviewPaper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance — supporting figure
Work Agents

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Qianli Ma*, Chang Guo*, Zhiheng Tian*, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang†

A transparent, human-in-the-loop multi-agent workflow for responding to peer reviews.

ACL 2026 · Findings
Human-Agent Collaborative Paper-to-Page Crafting — overviewHuman-Agent Collaborative Paper-to-Page Crafting — supporting figure
Work Agents

Human-Agent Collaborative Paper-to-Page Crafting

Qianli Ma*, Siyu Wang*, Yilin Chen*, Yinhao Tang*, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang†

Turning research papers into project pages with human–agent collaboration, paired with PageBench for evaluation.

Preprint · 2025
CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs — overviewCircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs — method or evaluation figure
LLM Post-training & Merging

CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs

Shaobo Wang*†, Yongliang Miao*, Yuancheng Liu, Qianli Ma, Ning Liao, Linfeng Zhang†

Selecting compact, high-quality reasoning data by measuring its influence on the attention heads that form a model’s mathematical reasoning circuits.

CVPR 2025
Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning — overviewDecouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning — supporting figure
Visual Generative Models

Decouple-Then-Merge: Finetune Diffusion Models as Multi-Task Learning

Qianli Ma, Xuefei Ning, Dongrui Liu, Li Niu†, Linfeng Zhang†

Decouple diffusion finetuning into denoising tasks, then merge them into a stronger model.

CVPR 2025
Efficient Diffusion as Low Light Enhancer — overviewEfficient Diffusion as Low Light Enhancer — supporting figure
Visual Generative Models

Efficient Diffusion as Low Light Enhancer

Guanzhou Lan*, Qianli Ma*, Yuqi Yang, Zhigang Wang, Dong Wang, Xuelong Li†, Bin Zhao†

Efficient diffusion modeling for low-light image enhancement.

ACL 2025 · Main
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint — overviewLED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint — supporting figure
LLM Post-training & Merging

LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint

Qianli Ma*, Dongrui Liu*, Qian Chen, Linfeng Zhang, Jing Shao†

Mitigating safety–utility conflicts when merging large language models.

TPAMI 2025
VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models — overviewVBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models — supporting figure
Visual Generative ModelsBenchmarks & Surveys

VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models

Ziqi Huang, Fan Zhang, Xiaojie Xu, Yinan He, Jiashuo Yu, Ziyue Dong, Qianli Ma, Nattapol Chanpaisit, Chenyang Si, Yuming Jiang, Yaohui Wang, Xinyuan Chen, Ying-Cong Chen, Limin Wang, Dahua Lin†, Yu Qiao†, Ziwei Liu†

A comprehensive benchmark suite for evaluating video generative models.

Preprint · 2025
Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free — overviewToken Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free — supporting figure
Visual Generative Models

Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free

Evelyn Zhang, Bang Xiao, Fufu Yu, Jiayi Tang, Chang Zou, Ke Yan, Shouhong Ding, Qianli Ma, Fei Ren, Linfeng Zhang†

Accelerating Stable Diffusion with token pruning and feature caching.

Preprint · 2025
RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling — overviewRAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling — supporting figure
Visual Generative ModelsLLM Post-training & Merging

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao†, Xinyuan Chen†, Yaohui Wang†, Li Niu†

Cross-stage prompt optimization for text-to-video generation through data alignment and test-time scaling.

Survey · 2025
Survey of General End-to-End Autonomous Driving: A Unified Perspective — overview
Benchmarks & Surveys

Survey of General End-to-End Autonomous Driving: A Unified Perspective

Yixiang Yang, Chuanrong Han, Runhao Mao, Hanshi Wang, Zhiwen Chen, Yantai Yang, Qianli Ma, Xuesong Chen, Shaoshuai Shi, Zhipeng Zhang†

A unified view of conventional, vision-language, and hybrid approaches to end-to-end autonomous driving.

04

Education

2025.04 — Present

Shanghai Jiao Tong University

Ph.D. in Artificial Intelligence

School of Artificial Intelligence
Advisor: Prof. Zhipeng Zhang

2022.09 — 2025.03

Shanghai Jiao Tong University

M.Sc. in Computer Science

Department of Computer Science and Engineering
Advisors: Prof. Li Niu and Prof. Linfeng Zhang

2018.09 — 2022.06

Southeast University

B.Eng. in Instrument Science and Control Technology

School of Instrument Science and Engineering

05

Research and Industry Experience

2025.02 — Present

Shanghai AI Laboratory

Research Intern

Advised by Dr. Yanan Sun and Dr. Yanhong Zeng

2024.01 — 2024.07

Shanghai AI Laboratory

Research Intern

Advised by Prof. Ziwei Liu; collaborated with Ziqi Huang

2023.07 — 2023.10

Baidu

Machine Learning Engineering Intern · Paddle Team

06

Service & Honors

Academic service

Conference reviewer
ICML, ICLR, ICCV, CVPR, ECCV, COLM, ARR, NeurIPS, ACM MM, AAAI

Teaching

AI2805 · Digital Signal and Image Processing
Teaching Assistant · SJTU · Spring 2026

AI7002 · AI Ethics
Teaching Assistant · SJTU · Autumn 2025

Honors & awards

  • Top Reviewer · NeurIPS 2026
  • Gold Reviewer · ICML 2026
  • Top 3 · IROS 2025 RoboSense Challenge, Driving with Language
  • First-Class Graduate Academic Scholarship · 2023, 2024
  • Freshman Graduate Academic Scholarship · 2022
  • Undergraduate Course Scholarship · 2020, 2021