胡钦哲

主页 / 论文

论文

加粗为本人;* 表示共同第一作者。点击图片可放大。

Universal Test-Time Training 架构图:展开的 uTTT 块,以及跨块共享的快权重专家池(uTTT-MoE)或共享稠密快权重算子(uTTT-Dense)。

Universal Test-Time Training

Qinzhe Hu*,Zefan Cai*,Ziqiao Ma,Hao Tan,Junjie Hu
* 共同第一作者
COLM 2026 Efficient Reasoning Workshop SpotlightNeurIPS 2026 审稿中

把测试时训练的快权重在整个网络深度上共享,而不是每层各存一份私有状态;模型因此成为一个跨(块,层)的单一递归,并在相同状态规模下提升长上下文检索能力。

Universal Test-Time Training 架构图:展开的 uTTT 块,以及跨块共享的快权重专家池(uTTT-MoE)或共享稠密快权重算子(uTTT-Dense)。

TF-MoE 总览:梅尔子带切分的 Conformer 骨干、交替的频率维与时间维 MoE Conformer 块,以及带时间/子带路由器的稀疏 MoE 前馈模块。

TF-MoE: Time-Frequency Mixture-of-Experts for Efficient Speech Separation

Qinzhe Hu,Chenda Li,Wangyou Zhang,Shujie Liu,Yan Lu,Yanmin Qian
INTERSPEECH 2026 Oral

在时间帧和梅尔频带两个维度上稀疏路由专家的混合专家框架,在几乎不增加推理开销的前提下提升语音分离模型的容量(Libri2Mix 上以相近的 4.1 GMACs/s 超过 BSRNN 3.8 dB SDR)。

TF-MoE 总览:梅尔子带切分的 Conformer 骨干、交替的频率维与时间维 MoE Conformer 块,以及带时间/子带路由器的稀疏 MoE 前馈模块。

SmartThinker 优势计算流程:轨迹采样、按估计的最优长度计算长度奖励,以及不惩罚正确轨迹的动态奖励系数。

SmartThinker: Progressive Chain-of-Thought Length Calibration for Efficient Large Language Model Reasoning

Chenzhi Hu,Qinzhe Hu,Yuhang Xu,Junyi Chen,Ruijie Wang,Shengzhong Liu,Jianxin Li,Fan Wu,Guihai Chen
ICML 2026

基于 GRPO 的高效推理方法,通过渐进式思维链长度校准为每道题估计最优推理长度并动态调整长度奖励系数,在 AIME25 等基准上最多减少 52% 推理 token 的同时提升准确率。

SmartThinker 优势计算流程:轨迹采样、按估计的最优长度计算长度奖励,以及不惩罚正确轨迹的动态奖励系数。