Publications

Team members are underlined. * Equal contribution. # Corresponding author.

DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity

DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity

Kaijie Zheng*, Weiqin Wang*, Yile Wang#, Hui Huang

EMNLP 2026

Training-free DySem uses multilingual consensus to find sample-specific semantic components and compute similarity via dynamic dimensions, not hidden states.

Assessment of Generative Named Entity Recognition in the Era of Large Language Models

Assessment of Generative Named Entity Recognition in the Era of Large Language Models

Qi Zhan, Yile Wang#, Hui Huang

EMNLP Findings 2026

Our study compares generative NER with encoder methods, showing modern LLM extraction remains sensitive to formats, labels, and memorization.

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

Yuxuan Yang*, Feiyang Li*, Yile Wang#

arXiv 2026

DiARC creates ARC preference pairs via output transformations, DSL inversions, and targeted edits, helping LLMs reject near-miss solutions and induce rules.

Property Enhanced Instruction Tuning for Multi-Task Molecule Generation with Large Language Models

Property Enhanced Instruction Tuning for Multi-Task Molecule Generation with Large Language Models

Xuan Lin, Long Chen, Yile Wang#, Yangyang Chen, Xiangxiang Zeng

IJCAI 2026

PEIT aligns molecular structures, text, and biochemical properties to create instructions for captioning, generation, property prediction, and constrained design.

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

Weiqin Wang, Yile Wang#, Kehao Chen, Hui Huang

ACL 2026

SCOPE estimates step-wise consensus confidence and subgroup rewards for test-time RL, yielding finer, more reliable signals than majority voting.

DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning

DeCoVec: Building Decoding Space based Task Vector for Large Language Models via In-Context Learning

Feiyang Li, Yile Wang#

ACL Findings 2026

DeCoVec builds decoding-space task vectors from in-context examples, steering next-token distributions to improve reasoning without weight or activation changes.

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

SemPA: Improving Sentence Embeddings of Large Language Models through Semantic Preference Alignment

Ziyang Chen*, Zhenxuan Huang*, Yile Wang#, Weiqin Wang, Lu Yin, Hui Huang

ACL Findings 2026

SemPA uses paraphrase pairs to align LLM semantic preferences, improving sentence embeddings while preserving general language abilities.

AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models

AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models

Zhanyu Shen, Sijie Cheng, Zhicheng Guo, Weiqin Wang, Yile Wang#, Hui Huang

ACL Findings 2026

AnchorMem stores atomic facts as retrieval anchors while preserving their contexts, then uses associative events to build more accurate long-context memory.

Evaluating Memory Capability in Continuous Lifelog Scenario

Evaluating Memory Capability in Continuous Lifelog Scenario

Jianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng

ACL Findings 2026

LifeDialBench introduces EgoMem and LifeMem subsets and online evaluation, showing raw-text retrieval can beat complex systems when context fidelity matters.

Pre-Training a Graph Recurrent Network for Text Understanding

Pre-Training a Graph Recurrent Network for Text Understanding

Yile Wang, Linyi Yang, Zhiyang Teng, Ming Zhou, Yue Zhang

TPAMI 2025

We pre-train a linear-complexity graph recurrent network over token and sentence nodes, enabling attention-free English and Chinese text understanding.

LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations

LDIR: Low-Dimensional Dense and Interpretable Text Embeddings with Relative Representations

Yile Wang, Zhanyu Shen, Hui Huang

ACL Findings 2025

LDIR relates text to selected anchors, yielding dense, low-dimensional, interpretable embeddings competitive in similarity, retrieval, and clustering.

Ranked Voting based Self-Consistency of Large Language Models

Ranked Voting based Self-Consistency of Large Language Models

Weiqin Wang, Yile Wang#, Hui Huang

ACL Findings 2025

RVSC asks LLMs for ranked answers and aggregates them with ranked voting, improving reliability on reasoning tasks.

Perspective Transition of Large Language Models for Solving Subjective Tasks

Perspective Transition of Large Language Models for Solving Subjective Tasks

Xiaolong Wang, Yuanchi Zhang, Ziyue Wang, Yuzhuang Xu, Fuwen Luo, Yile Wang#, Peng Li, Yang Liu

ACL Findings 2025

RPT lets LLMs choose direct, role, or third-person perspectives, improving subjective reasoning across stance, sarcasm, culture, and social norms.

MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models

MUCAR: Benchmarking Multilingual Cross-Modal Ambiguity Resolution for Multimodal Large Language Models

Xiaolong Wang, Zhaolu Kang, Wangyuxuan Zhai, Xinyue Lou, Yunghwei Lai, Ziyue Wang, Yawen Wang, Kaiyu Huang, Yile Wang#, Peng Li, Yang Liu

EMNLP 2025

MUCAR benchmarks multilingual cross-modal ambiguity resolution by pairing ambiguous texts and images, requiring MLLMs to infer one grounded interpretation.

Improving Abstract Reasoning Ability of Large Language Models through Mixture Program-based Data Synthesis

Improving Abstract Reasoning Ability of Large Language Models through Mixture Program-based Data Synthesis

Yile Wang, Hui Huang

CCL 2025

We synthesize abstract-reasoning data from low-level code, high-level DSL programs, and shuffle augmentation, improving LLMs on ARC-style tasks.

AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models

AttriLens-Mol: Attribute Guided Reinforcement Learning for Molecular Property Prediction with Large Language Models

Xuan Lin, Long Chen, Yile Wang#

arXiv 2025

AttriLens-Mol guides RL with rationality rewards for molecular attributes, helping LLMs use chemically relevant attributes in property prediction.

Leveraging Language-based Representations for Better Solving Symbol-related Problems with Large Language Models

Leveraging Language-based Representations for Better Solving Symbol-related Problems with Large Language Models

Yile Wang, Sijie Cheng, Zixin Sun, Peng Li, Yang Liu

COLING 2025

S2L converts symbolic inputs into language-based representations, clarifying reasoning for abstract tasks, chemical property prediction, tables, and more.