AAPA-8B

This repository contains the 8B A-GRPO checkpoint released with AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models.

AAPA is a plug-in framework that augments post-training objectives with a sentence-level adversarial anchoring signal. It compares policy rollouts with offline expert responses using a fixed lightweight discriminator, providing semantic grounding during preference optimization.

This checkpoint is trained from Qwen3-8B using the AAPA code release.

Resources

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Jingleqian/AAPA-8B"

tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

Citation

@article{aapa2025,
  title={AAPA: Adversarially Anchored Preference Alignment for Post-Training of Large Language Models},
  author={Faqiang Qian and Kang An and Weikun Zhang and Ziliang Wang and Xuhui Zheng and Liangjian Wen and Yong Dai and Mengya Gao and Yichao Wu},
  journal={arXiv preprint arXiv:2509.25148},
  year={2025}
}
Downloads last month
32
Safetensors
Model size
8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Jingleqian/AAPA-8B

Finetuned
Qwen/Qwen3-8B
Finetuned
(1969)
this model
Quantizations
2 models

Dataset used to train Jingleqian/AAPA-8B

Collection including Jingleqian/AAPA-8B

Paper for Jingleqian/AAPA-8B