-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathlatest.tex
More file actions
2110 lines (893 loc) · 231 KB
/
Copy pathlatest.tex
File metadata and controls
2110 lines (893 loc) · 231 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
936
937
938
939
940
941
942
943
944
945
946
947
948
949
950
951
952
953
954
955
956
957
958
959
960
961
962
963
964
965
966
967
968
969
970
971
972
973
974
975
976
977
978
979
980
981
982
983
984
985
986
987
988
989
990
991
992
993
994
995
996
997
998
999
1000
\documentclass[9pt, a4paper]{article}
\usepackage{geometry}
\geometry{scale=0.75}
\usepackage{setspace}
%\usepackage{fontspec}
\usepackage{xeCJK}
\usepackage{ctex}
%\usepackage{CJKutf8}
\usepackage{zhnumber}
%\usepackage[english,chinese]{babel}
%\usepackage{polyglossia}
\usepackage{amsmath}
\usepackage{amssymb}
\usepackage{amsthm}
\usepackage{mathtools}
\usepackage{mathrsfs}
\usepackage{latexsym}
\usepackage{stmaryrd}
\usepackage{graphicx}
\usepackage{tikz}
\usepackage{tikz-cd}
%\usepackage[authoryear]{natbib}
%\usepackage{etoolbox}
\usepackage{xcolor}
\usepackage{hyperref}
\hypersetup{
colorlinks=true,
citecolor=green,
urlcolor=red,
bookmarksnumbered=true
}
%\usepackage{cleveref}
%\usepackage{enumitem}
%\usepackage{fancyhdr}
%\usepackage{lmodern}
%\usepackage{pdfpages}
\theoremstyle{plain}
\newtheorem{theorem}{定理}
\newtheorem{lemma}[theorem]{引理}
\newtheorem{corollary}[theorem]{推论}
\newtheorem{proposition}[theorem]{命题}
\theoremstyle{definition}
\newtheorem{definition}[theorem]{定义}
\newtheorem{example}[theorem]{示例}
\newtheorem{remark}[theorem]{注记}
\theoremstyle{remark}
\definecolor{arxivblue}{RGB}{0, 102, 204}
\newcommand{\arxivwithtarget}[3]{\hypertarget{#1}{}\href{https://arxiv.org/abs/#1}{#1}, \textbf{\textcolor{arxivblue}{#2}}, #3. }
\newcommand{\arxiv}[3]{\href{https://arxiv.org/abs/#1}{#1}, \textbf{\textcolor{arxivblue}{#2}}, #3. }
\begin{document}
\begin{center}
\Huge\textbf{不漏arXiv:\today \footnote{本文档由\href{https://github.com/vegetablefj/bluearXiv-ai}{bluearXiv-ai}自动生成. 实际抓取的是``new''页面的数据, 即最近的有所在分类论文变动的一天的数据. This document is automatically generated by \href{https://github.com/vegetablefj/bluearXiv-ai}{bluearXiv-ai}. The data actually captured is from the ``new'' page, that is, the data of the most recent day when there were changes in corresponding subjects.}\footnote{感谢arXiv提供的服务. Thanks for services prodived by arXiv.}\footnote{评论和精选由AI生成, 不代表任何人对论文本身的看法. 精选依赖于论文与给定关键词的匹配度. Comments and selection of good papers are generated by AI, not showing anyone's point of view about those papers. The selection also depends on the matched-degrees between papers and given keywords.}\footnote{下面的计数基于主学科, 不计重数. The following counters are based on main subject, not counting multiplicities.}}
\end{center}
\begin{center}
%counter_begin
cs.LG: 96
cs.AI: 77
cs.IR: 6
cs.CL: 58
cs.DS: 10
others: 132
%counter_end
\end{center}
\setcounter{section}{-1}
\section{精选 Selections}
%selection_begin
\arxiv{2608.11427}{Three Tokens Force Exponential Feature Rank in Nonnegative Kernel Attention}{Vicente Opazo}\textbf{cs.LG}. \hyperlink{2608.11427}{$\rightsquigarrow$}
\arxiv{2608.11519}{FLARE++: Low-rank attention with dynamic attention routing}{Vedant Puri, Yongjie Jessica Zhang, Levent Burak Kara}\textbf{cs.LG}. \hyperlink{2608.11519}{$\rightsquigarrow$}
\arxiv{2608.11612}{Dion3: Full-Stack Orthogonal Updates}{Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen, Tri Dao, John Langford}\textbf{cs.LG}, cs.AI. \hyperlink{2608.11612}{$\rightsquigarrow$}
\arxiv{2608.11623}{FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting}{Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji}\textbf{cs.LG}, cs.AI, cs.NI, eess.SP. \hyperlink{2608.11623}{$\rightsquigarrow$}
\arxiv{2608.11654}{Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem}{Hongyao Tang}\textbf{cs.LG}. \hyperlink{2608.11654}{$\rightsquigarrow$}
\arxiv{2608.11658}{Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning}{Zijian Zhao, Sen Li}\textbf{cs.LG}, cs.AI, cs.MA. \hyperlink{2608.11658}{$\rightsquigarrow$}
\arxiv{2608.11661}{Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads}{Zijian Zhao, Sen Li}\textbf{cs.LG}, cs.AI. \hyperlink{2608.11661}{$\rightsquigarrow$}
\arxiv{2608.11674}{GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs}{Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao}\textbf{cs.LG}, cs.AI. \hyperlink{2608.11674}{$\rightsquigarrow$}
\arxiv{2608.11716}{Chain-of-Thought Shows the Path to a Tree: Realizing Branching Complexity}{Debanjan Dutta, Anish Chakrabarty, Swagatam Das}\textbf{cs.LG}. \hyperlink{2608.11716}{$\rightsquigarrow$}
\arxiv{2608.11749}{MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning}{Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun}\textbf{cs.LG}, cs.AI, stat.ML. \hyperlink{2608.11749}{$\rightsquigarrow$}
\arxiv{2608.11970}{TESLA: Taylor Expansion of Sinusoidal Learnable Activations}{Daehwa Ko, Jaehyeon Kim, Seunghyun Ham, Jay Hoon Jung}\textbf{cs.LG}. \hyperlink{2608.11970}{$\rightsquigarrow$}
\arxiv{2608.12084}{NAE: Normalizing AutoEncoder}{Muhammad Abdur Rafae, Niels Landwehr}\textbf{cs.LG}. \hyperlink{2608.12084}{$\rightsquigarrow$}
\arxiv{2608.12231}{An Efficient Near-Optimal Algorithm for Adversarial $m$-Set Bandits}{Francesco Bacchiocchi, Tommaso Cesari, Roberto Colomboni}\textbf{cs.LG}. \hyperlink{2608.12231}{$\rightsquigarrow$}
\arxiv{2608.12307}{AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses}{Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke}\textbf{cs.LG}, cs.AI, cs.CL. \hyperlink{2608.12307}{$\rightsquigarrow$}
\arxiv{2608.11224}{Harnessing agent memory to build lifelong AI partners for materials scientists}{Siyu Liu, Bo Hu, Beilin Ye, He Cao, David J. Srolovitz, Tongqi Wen}\textbf{cs.AI}, cond-mat.mtrl-sci, cs.CE, cs.CL, cs.MA. \hyperlink{2608.11224}{$\rightsquigarrow$}
\arxiv{2608.11246}{Towards the Harness of Embodied Agents}{Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu}\textbf{cs.AI}, cs.LG, cs.RO. \hyperlink{2608.11246}{$\rightsquigarrow$}
\arxiv{2608.11248}{EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents}{Yuxi Qian, Yuxiang Ren}\textbf{cs.AI}, cs.MA. \hyperlink{2608.11248}{$\rightsquigarrow$}
\arxiv{2608.11250}{AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search}{Weicheng Ye, Youran Sun, Xingyu Ren, Shunyao Yu, Chugang Yi, Haizhao Yang}\textbf{cs.AI}, cs.MA, q-fin.CP, q-fin.PM. \hyperlink{2608.11250}{$\rightsquigarrow$}
\arxiv{2608.11260}{Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning}{Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang}\textbf{cs.AI}, cs.CV. \hyperlink{2608.11260}{$\rightsquigarrow$}
\arxiv{2608.11323}{Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations}{Vasundra Srinivasan}\textbf{cs.AI}, cs.LG. \hyperlink{2608.11323}{$\rightsquigarrow$}
\arxiv{2608.11676}{XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication}{Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee}\textbf{cs.AI}. \hyperlink{2608.11676}{$\rightsquigarrow$}
\arxiv{2608.11768}{HyperANFIS: Enhancing Rule Representation and Interpretability in Adaptive Neuro-Fuzzy Systems via Hyperbolic Geometry}{Haoran Pei, Zhao Su, Zetao Lin, Haoran Li, Jun Shen, Qi Zhu, Lan Guo, Qingguo Zhou, Binbin Yong}\textbf{cs.AI}. \hyperlink{2608.11768}{$\rightsquigarrow$}
\arxiv{2608.11775}{The Sleeping Agent: What Gist-Based Context Compression Loses and Why}{Nicholas E. Kyrkewood}\textbf{cs.AI}, cs.CL. \hyperlink{2608.11775}{$\rightsquigarrow$}
\arxiv{2608.11977}{Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection}{Chaoran Chen, Vy Nguyen, Ziji Zhang, Abhinav Gullapalli, Ziyi Wang, Yuxuan Lu, Dakuo Wang, Jing Huang, Zhou Yu, Jin Lai}\textbf{cs.AI}. \hyperlink{2608.11977}{$\rightsquigarrow$}
\arxiv{2608.11994}{Claim-Level Reliability Assessment for Efficient Test-Time Reasoning}{Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang}\textbf{cs.AI}, cs.CL. \hyperlink{2608.11994}{$\rightsquigarrow$}
\arxiv{2608.12036}{Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence}{Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen}\textbf{cs.AI}, cs.CL, cs.HC, cs.LG, cs.MA. \hyperlink{2608.12036}{$\rightsquigarrow$}
\arxiv{2608.12249}{An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS}{Yuzhong Shen, Masha Sosonkina, Peng Xu, Mark S. Gordon}\textbf{cs.AI}. \hyperlink{2608.12249}{$\rightsquigarrow$}
\arxiv{2608.12282}{VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies}{Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor}\textbf{cs.AI}. \hyperlink{2608.12282}{$\rightsquigarrow$}
\arxiv{2608.11846}{From Overlooked to Explored: Recovering Item Relations via Mixture of Perspectives for Sequential Recommendation}{Junyoung Kim, Wonbin Kweon, Woojoo Kim, Jaehyung Lim, Dongha Kim, Hwanjo Yu}\textbf{cs.IR}. \hyperlink{2608.11846}{$\rightsquigarrow$}
\arxiv{2608.11980}{HCGRec: Hint-Conditioned Generative Recommendation with Semantic IDs}{Kangning Zhang, Haotian Fang, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, Yong Yu}\textbf{cs.IR}, cs.AI. \hyperlink{2608.11980}{$\rightsquigarrow$}
\arxiv{2608.12184}{Making Collaborative Signals Count: Graph-Aware Large Language Models for Sequential Recommendation}{Fenglin Yan, Bohao Wang, Jian Zhang, Yu Cui, Tongya Zheng, Ye Feng, Can Wang, Jiawei Chen}\textbf{cs.IR}. \hyperlink{2608.12184}{$\rightsquigarrow$}
\arxiv{2608.11232}{Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs}{Ruoxi Zhao, Maziar Raissi}\textbf{cs.CL}, cs.AI. \hyperlink{2608.11232}{$\rightsquigarrow$}
\arxiv{2608.11338}{Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost}{Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews}\textbf{cs.CL}, cs.LG. \hyperlink{2608.11338}{$\rightsquigarrow$}
\arxiv{2608.11552}{Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents}{Dylan Bouchard, Mohit Singh Chauhan}\textbf{cs.CL}, cs.AI, cs.LG. \hyperlink{2608.11552}{$\rightsquigarrow$}
\arxiv{2608.11624}{Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs}{Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür}\textbf{cs.CL}, cs.AI. \hyperlink{2608.11624}{$\rightsquigarrow$}
\arxiv{2608.11805}{Hybrid Gated Attention}{Zekun Zhou, Ruobing Xie, Lanrui Wang, Weixuan Sun}\textbf{cs.CL}. \hyperlink{2608.11805}{$\rightsquigarrow$}
\arxiv{2608.12129}{SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges}{Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li}\textbf{cs.CL}. \hyperlink{2608.12129}{$\rightsquigarrow$}
\arxiv{2608.12218}{Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge}{Arda Uzunoglu, Benjamin van Durme, Daniel Khashabi}\textbf{cs.CL}, cs.AI. \hyperlink{2608.12218}{$\rightsquigarrow$}
\arxiv{2608.11413}{Graphic Matroid Secretary without the Graph}{Paul Dütting, Renato Paes Leme, Martin Pál, Neel Patel}\textbf{cs.DS}. \hyperlink{2608.11413}{$\rightsquigarrow$}
\arxiv{2608.11858}{A Tight Scale-Locality Bound for Partial Detection in Non-Adaptive Group Testing}{Nader H. Bshouty}\textbf{cs.DS}. \hyperlink{2608.11858}{$\rightsquigarrow$}
\arxiv{2608.12075}{Polynomial-Time Singular Witnesses for Non-SNS Sign Patterns}{Tao Jiang, Minbo Gao, Shaowei Cai}\textbf{cs.DS}, cs.DM. \hyperlink{2608.12075}{$\rightsquigarrow$}
\arxiv{2608.11274}{Agent Safety Should Be a Runtime Contract}{Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang}\textbf{cs.CR}, cs.AI. \hyperlink{2608.11274}{$\rightsquigarrow$}
\arxiv{2608.11321}{Spectral graph clustering with inhomogeneous latent geometry}{Konstantin Avrachenkov, Lucas S. Sibemberg, Alexander Van Werde}\textbf{cs.SI}, cs.LG, math.PR, stat.ML. \hyperlink{2608.11321}{$\rightsquigarrow$}
\arxiv{2608.11335}{Dual-Domain Cross-Modal Decoding for Clinical Text-Guided Medical Image Segmentation}{Md Maklachur Rahman, Tracy Hammond}\textbf{cs.CV}, cs.AI, eess.IV. \hyperlink{2608.11335}{$\rightsquigarrow$}
\arxiv{2608.11363}{Adaptation of Generalist Robot Policies with Minimal Data}{Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar}\textbf{cs.RO}, cs.LG. \hyperlink{2608.11363}{$\rightsquigarrow$}
\arxiv{2608.11469}{The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark}{Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang}\textbf{cs.CR}, cs.AI, cs.SE. \hyperlink{2608.11469}{$\rightsquigarrow$}
\arxiv{2608.11537}{Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment}{Weize Cai, Yongqi Dong, Zhida Shao, Zixin Fu}\textbf{cs.CV}, cs.AI, cs.LG, eess.IV. \hyperlink{2608.11537}{$\rightsquigarrow$}
\arxiv{2608.11739}{G0.5: One Autoregressive Stream for Robot Reasoning and Action}{Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao}\textbf{cs.RO}, cs.AI. \hyperlink{2608.11739}{$\rightsquigarrow$}
\arxiv{2608.11889}{DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation}{Anik Pramanik, Murat Kantarcioglu, Vincent Oria, Shantanu Sharma}\textbf{cs.DB}, cs.AI, cs.CL, cs.IR. \hyperlink{2608.11889}{$\rightsquigarrow$}
\arxiv{2608.11911}{Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Quadratic Qubit Hamiltonians}{Timothy Heightman, Elena Orlova, Philip Mantrov, Aleksei Ustimenko}\textbf{quant-ph}, cond-mat.dis-nn, cond-mat.str-el, cs.AI. \hyperlink{2608.11911}{$\rightsquigarrow$}
\arxiv{2608.12032}{LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration}{Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu}\textbf{cs.CV}, cs.AI. \hyperlink{2608.12032}{$\rightsquigarrow$}
\arxiv{2608.12187}{HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation}{Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei}\textbf{cs.CV}, cs.AI. \hyperlink{2608.12187}{$\rightsquigarrow$}
\arxiv{2608.12196}{M-Net: Integrating Spectral Features and Physical Field Operators into Deep Learning for Medical Image Segmentation}{Jing Zhu, Ye Wang, Fumin Wang}\textbf{cs.CV}, cs.AI. \hyperlink{2608.12196}{$\rightsquigarrow$}
\arxiv{2608.12230}{Few-Shot Ordinal Learning for Day-Wise Freshness Estimation with Hyperspectral Fish Images}{Kazi Nabiul Alam, Pooneh Bagheri Zadeh, Akbar Sheikh-Akbari}\textbf{cs.CV}, cs.AI, eess.IV, eess.SP. \hyperlink{2608.12230}{$\rightsquigarrow$}
\arxiv{2608.12273}{Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents}{Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui}\textbf{cs.CR}, cs.AI. \hyperlink{2608.12273}{$\rightsquigarrow$}
\arxiv{2608.12290}{Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence}{Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson}\textbf{cs.CV}, cs.AI, cs.MM. \hyperlink{2608.12290}{$\rightsquigarrow$}
\arxiv{2608.12313}{AVA-Encoder: Towards Agent-Native Video Representation Learning}{Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Hua}\textbf{cs.CV}, cs.CL. \hyperlink{2608.12313}{$\rightsquigarrow$}
%selection_end
%body_begin
\section{cs.LG}
\arxivwithtarget{2608.11254}{FarSky: Task-Aware Latent-Space Coupling for Generative Intra-Hour Solar Forecasting}{Yann Fabel, Bijan Nouri, Milon Miah, Niklas Blum, Luis F. Zarzalejo, Julia Kowalski, Robert Pitz-Paal}\textbf{cs.LG}, physics.ao-ph, stat.AP.
本文提出FarSky, 一种基于latent-space coupling的生成式太阳辐照预测框架, 通过multi-task autoencoder学习共享表示并用latent diffusion model生成未来状态, 在西班牙数据集上提升了预测技能和ramp事件检测性能. 该方法与关键词关联较弱, 属于应用性改进.
\arxivwithtarget{2608.11256}{Why AI Detection Fails for Academic Integrity}{Jonathan A. Karr Jr, Grigorii Khvatskii, Ting Hua, Nitesh V. Chawla}\textbf{cs.LG}, cs.CY.
本文通过控制实验量化了商业AI检测器在学术诚信场景中的失效问题, 发现其无法区分AI编辑与完整LLM草稿, 且对合规AI辅助的误报率远高于未修改原文, 而人类化改写可近乎完全规避检测. 研究指出检测器分数不应作为学术不端的独立证据, 但未提出新的检测方法或理论框架.
\arxivwithtarget{2608.11279}{Basin: Efficient and Extensible Numerical Optimization in Rust}{Johan Larsson}\textbf{cs.LG}, math.OC.
Basin是一个面向Rust编程语言的数值优化库, 旨在为用户提供统一的问题表述和求解接口, 并包含多种求解器及对约束的支持. 该工作主要聚焦于软件工程实现, 而非提出新的数学优化方法.
\arxivwithtarget{2608.11281}{Federated Learning for Distributed CNC Tool Wear Prediction}{Afsana Khan, Morris Stallmann, Marcin Pietrasik, Charis Kouzinopoulos, Anna Wilbik}\textbf{cs.LG}, cs.AI.
本文研究了联邦学习在分布式CNC刀具磨损预测中的应用, 通过模拟客户端分布数据, 比较了联邦模型与集中式和本地模型的性能, 表明联邦学习在保护数据隐私的同时接近集中式学习效果. 该工作主要面向工业应用场景, 与关键词列表中的方向关联较弱.
\arxivwithtarget{2608.11318}{Terminal Symmetry as a Decision Resource: Statewise Refinement for Anytime Verified Construction}{Yi Liu}\textbf{cs.LG}, cs.AI.
本文提出了一种利用终端对称性作为决策资源的序列构造方法, 通过传输-细化-验证框架提升构造任务的效率, 并在多个基准上验证了其有效性.
\arxivwithtarget{2608.11324}{Contextual Quality-Diversity Evolutionary Reinforcement Learning for HVAC Control in Tropical Commercial Buildings}{Tran Le Vu}\textbf{cs.LG}, cs.AI, cs.NE, math.OC.
本文提出了一种用于热带商业建筑暖通空调控制的情境质量-多样性进化强化学习控制器, 通过维护策略档案并结合安全过滤机制进行监督控制, 并在简化环境上进行了年度回测评估.
\arxivwithtarget{2608.11327}{Long-Horizon Forecasting of Complete Financial Statements with Forma}{Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh}\textbf{cs.LG}, q-fin.CP.
本文提出Forma模型, 用于预测完整财务报表未来1-20季度的78个科目, 并发布ProForma-20Q基准. 实验表明其优于多种基线方法, 但方法创新性有限, 与关键词关联较弱.
\arxivwithtarget{2608.11342}{Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport}{Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon}\textbf{cs.LG}, cs.CL.
本文提出Weightless Fine-Tuning (WFT), 一种无需权重更新的解码时方法, 通过logit-space transport近似监督微调的效果, 在个性化任务中降低计算成本. 该方法在LaMP基准上接近SFT性能, 但未涉及关键词相关领域.
\arxivwithtarget{2608.11349}{Dynamics Models for Offline Hyperparameter Selection in Real-World RL}{Jordan Coblin, Han Wang, Martha White, Adam White}\textbf{cs.LG}, cs.AI.
本文首次将calibration models应用于真实工业场景(市政水处理厂) , 评估了包括k-nearest neighbors模型在内的多种方法在高维非平稳传感器数据上的表现, 证明其能生成长期rollouts并恢复超参数敏感性趋势, 为离线强化学习部署提供了概念验证.
\arxivwithtarget{2608.11359}{Market-Information-Aware Gated-LoRA of Foundation Models for Transferable Day-Ahead Electricity Price Forecasting}{Hang Fan, Wei Wei, Shengwei Mei}\textbf{cs.LG}.
本文提出了一种基于市场信息感知的gated-LoRA框架, 将Chronos-2时间序列基础模型迁移至日前电价预测, 通过多源市场信息接口和状态依赖门控机制在数据稀缺市场中实现跨市场迁移, 实验显示其性能优于零样本和vanilla LoRA基线. 该工作聚焦于电力市场预测的工程应用, 与关键词列表中的核心概念关联较弱.
\arxivwithtarget{2608.11361}{Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter}{Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu}\textbf{cs.LG}, cs.CL, cs.PF.
本文研究了LLM中tokenizer词汇表大小作为部署环境相关的基础设施参数, 提出了生命周期总成本模型, 并通过实验表明推理最优词汇量随服务批次变化, 但整体方法较为常规, 与关键词关联度低.
\arxivwithtarget{2608.11368}{PAIR: Pairwise-Aware Inclusion Reweighting for Adaptive Rollout Allocation in RLVR}{Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes}\textbf{cs.LG}.
本文提出PAIR方法, 通过将rollout配对梯度项视为对比图边并加权修正, 解决了RLVR中自适应分配预算时的统计偏差问题, 在Qwen3模型上提升了准确率并减少了生成token数. 该方法与关键词列表中的主题关联较弱.
\arxivwithtarget{2608.11375}{Towards an approach to multivariate outlier detection for District Heating System data}{Rajko Turudija, Dušan Stojiljković, Milan Zdravković, Marko Ignjatović}\textbf{cs.LG}, eess.SY.
本文测试了多种多变量离群点检测方法(如Mahalanobis距离、PCA、Isolation Forest和Hotelling's T-squared test) 在区域供热系统数据中的应用, 并采用集成方法综合三种有效方法的结果. 研究旨在识别异常运行工况, 但与关键词列表中的主题关联较弱.
\arxivwithtarget{2608.11383}{Reoptimization Algorithms for Contextual Bandits with Knapsack Constraints}{Zhen Xu}\textbf{cs.LG}, math.OC.
本文研究了带背包约束的上下文老虎机问题, 提出了一种基于上置信界(UCB) 算法的自然扩展并结合再优化技术的新算法, 证明了其平均遗憾为$O((\ln T)^3/T)$, 优于文献中动态定价问题的$O(1/\sqrt{T})$界. 该工作主要贡献在于算法设计与遗憾分析, 但与关键词列表关联较弱.
\arxivwithtarget{2608.11390}{Mechanism Design for Generative Engines: From Exploitation toward Win-Win Outcomes}{Chen Xu, Zitian Guo, Chenyan Xiong}\textbf{cs.LG}.
本文研究了生成式引擎中内容提供者与平台之间的策略博弈, 提出了一种基于可验证内容奖励的机制VCR, 以缓解引用竞争导致的文档质量下降问题. 实验表明该机制在多个基准上优于现有防御方法.
\arxivwithtarget{2608.11410}{Unmasking Toxic Mimicry in Medical Offline Reinforcement Learning for ICU Sepsis Management via Counterfactual Clinical Audits}{Hangqi Ren, Junyi Liao}\textbf{cs.LG}, cs.CY.
本文提出Counterfactual Clinical Audit (CCA)框架, 用于审计ICU脓毒症管理中离线强化学习智能体的行为, 发现标准评估指标无法检测有害模仿模式. 通过MIMIC-III数据验证, CCA揭示部分模型在乳酸升高时反而降低血管加压药剂量, 与临床指南相悖.
\arxivwithtarget{2608.11419}{Diffusion-Based Data-Driven Assortment Optimization}{Junyi Liao, Xiaohui Jiang, Zhengwei Tong, Ethan X. Fang, Vahid Tarokh}\textbf{cs.LG}.
本文提出了一种基于guided discrete diffusion的模型无关assortment optimization框架, 通过将assortments表示为binary vectors并利用学习到的reverse diffusion process进行stochastic search, 引入reward-guided机制平衡探索与利用. 实验表明该方法在模型误设下仍能识别高质量解, 但方法本身与关键词列表关联较弱.
\arxivwithtarget{2608.11423}{Analysis of Federated Aggregation under Model Poisoning and Backdoor Attacks: A Reconstructed Cross-Dataset and Cross-Architecture Benchmark}{Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta}\textbf{cs.LG}, cs.CR, cs.CV.
本文重建了一个跨数据集和跨架构的联邦聚合方法基准, 评估了五种聚合方法在模型投毒和后门攻击下的表现, 并审计了攻击指标与FedPARETO框架的实现细节. 研究发现Trimmed Mean和Krum在不同条件下表现最优, 但结果仅具描述性, 不构成统计估计或普适性结论.
\arxivwithtarget{2608.11424}{Click2Poly: A VLM for vector mapping buildings and walls}{Nicolas Girard, Jawher Ben Abdallah, Arno Gobbin, Liuyun Duan, Sacha Lepretre}\textbf{cs.LG}, cs.CV.
本文提出Click2Poly, 一种基于Florence-2视觉语言模型的人机交互AI助手, 用于加速建筑和墙体矢量地图的编辑过程, 并作为QGIS插件在实际生产环境中应用. 该方法主要关注交互式编辑效率, 与关键词中的核心数学或理论方向关联较弱.
\arxivwithtarget{2608.11427}{Three Tokens Force Exponential Feature Rank in Nonnegative Kernel Attention}{Vicente Opazo}\textbf{cs.LG}.
本文研究了kernel attention与full attention在表达能力上的本质差异, 证明了在Min-IP问题中, 对于包含三个token的序列, 任何单个归一化非负kernel attention head若要在误差低于$1/2$的情况下解决所有实例, 其特征维度必须达到$2^{\Omega(m)}$, 而dense softmax attention仅需$m$维即可. 该下界在上下文长度增长时趋近于精确的$2^m$特征实现, 且结论在位置依赖token映射和因果查询下依然成立. 此外, 对于具有有限字母表跨token通道的多头多层sketch模型, 作者证明了与独立答案数线性、与字母表大小对数相关的transcript下界. 该工作揭示了kernel attention在长上下文任务中的根本性局限, 与attention机制的表达效率密切相关.
\arxivwithtarget{2608.11431}{AutoGrable: What Is a Good Graph for a Table?}{Tamara Cucumides, Floris Geerts}\textbf{cs.LG}.
本文提出AutoGrable方法, 通过行划分的color-refinement准则评估表格到图构造的质量, 无需训练GNN即可选择最优列子集构建图结构, 实验表明其能高效筛选候选图并优于固定或随机构造方法.
\arxivwithtarget{2608.11435}{Variational Parameter Calibration with Physics-Aware Latent-Space Surrogates}{Qiyao Zhou, Xujia Zhu, Pierre Joli, Yu Cong, Sibo Cheng}\textbf{cs.LG}, physics.comp-ph, physics.data-an, physics.flu-dyn.
本文提出了一种基于物理感知的神经网络潜空间框架, 用于参数化动力系统的降阶前向建模和变分参数估计, 通过可微代理模型将物理参数映射到预测流场. 在计算流体动力学基准上的实验表明, 该方法在噪声、低分辨率等实际观测条件下相比标准代理模型能降低校准误差, 但整体方法属于工程性改进, 缺乏开创性.
\arxivwithtarget{2608.11446}{XGBoost "is all you need": the case of forecasting transmitted heat energy in District Heating Systems}{Milan Zdravković}\textbf{cs.LG}, eess.SY.
本文比较了XGBoost与LSTM在区域供热系统(DHS) 中预测传输热能的性能, 发现XGBoost在特定时间序列预测任务中优于LSTM, 且计算成本更低、环境影响更小. 研究通过误差分布分析解释了差异, 但方法本身缺乏开创性, 与关键词关联较弱.
\arxivwithtarget{2608.11465}{PAC-Bayes Beyond Parameter Space: Behavioral Equivalence, Z-Information, and Exact Complexity Decomposition}{Vasant G. Honavar, Satish Kumar Keshri, Neil Ashtekar, Zehao Liu}\textbf{cs.LG}, cs.AI.
本文通过可测行为映射和测度分解, 将经典PAC-Bayes KL散度精确分解为行为选择项和实现级项, 并定义了Z-information刻画两者差异. 该工作为理解过参数化系统中的泛化复杂度提供了新视角, 但未直接涉及关键词中的核心主题.
\arxivwithtarget{2608.11473}{Dual-Primal Graph VAEs for Noisy Label Aggregation}{Patrick Stinson, Nikolaus Kriegeskorte}\textbf{cs.LG}.
本文提出了一种基于图VAE的众包噪声标签聚合方法, 利用GAT消息传递在数据集邻接图及其对偶图上进行编码和解码, 将真实标签作为潜在变量进行无监督学习. 该方法在众包基准上取得较好性能, 并可通过扩展图结构融入辅助信息提升分类效果.
\arxivwithtarget{2608.11479}{Convergence Guarantees of Gradient Descent for Neural Networks via Generalized Lipschitz Smoothness}{Siqiao Mu, Diego Klabjan}\textbf{cs.LG}.
本文研究了梯度下降在一般前馈神经网络中的收敛性保证, 通过引入广义Lipschitz smoothness条件, 证明了在激活函数满足Lipschitz smooth等性质时, 最小梯度范数平方以$O(1/T^{1/L})$速率收敛到零. 该工作为神经网络优化理论提供了新的分析框架, 但与关键词列表关联较弱.
\arxivwithtarget{2608.11495}{Defending against Model Extraction for GNNs with Model Reprogramming}{Yan Wen, Zhenyi Wang, Heng Huang}\textbf{cs.LG}, cs.CR, cs.IR.
本文提出GraphRP框架, 利用Model Reprogramming为GNNs构建主动防御机制, 通过结构感知门控机制动态调整决策边界以抵御模型提取攻击, 并理论证明攻击者估计误差的下界. 实验表明该方法在保持良性查询效用的同时显著降低攻击有效性.
\arxivwithtarget{2608.11499}{HyperFix: Combinatorial Nonlinear Correction for Task Vector Merging}{Hyo Seo Kim, Ren Wang}\textbf{cs.LG}, cs.AI.
本文提出HyperFix, 一种轻量级hypernetwork, 用于预测任务向量合并中的子集条件非线性校正, 以解决不同任务子集合并时的线性限制问题. 实验表明其性能优于现有方法, 但方法本身属于工程性改进, 缺乏开创性或与关键词的显著关联.
\arxivwithtarget{2608.11508}{RelShap: Relationally Consistent Shapley Explanations}{Seungeun Lee, Joao Fonseca, Julia Stoyanovich}\textbf{cs.LG}.
本文提出RelShap框架, 将关系约束和数据溯源纳入Shapley值计算, 以生成更符合数据生成过程的解释, 并可与多种估计器组合使用. 实验表明其在受控设置中优于现有方法, 但方法本身属于改进性工作, 与关键词列表关联较弱.
\arxivwithtarget{2608.11511}{Let it Cook: Learning to Wait in Sequential Decision Making}{Christopher Watson, Arjun Krishna, Dinesh Jayaraman, Rajeev Alur}\textbf{cs.LG}, cs.AI.
本文提出在序贯决策中训练一个"等待策略"以决定何时及多久不采取行动, 通过带字典序目标的强化学习来最小化感知和决策频率, 同时不牺牲任务性能. 实验在多个离散和连续状态环境中验证了该方法能学习到显著的等待行为.
\arxivwithtarget{2608.11519}{FLARE++: Low-rank attention with dynamic attention routing}{Vedant Puri, Yongjie Jessica Zhang, Levent Burak Kara}\textbf{cs.LG}.
FLARE++提出了一种动态注意力路由的低秩注意力架构, 通过复用FLARE的encoder将输入token聚合成输入条件化的查询, 从而替代固定查询模板, 同时保持线性$O(NM)$复杂度和标准SDPA操作. 该方法在PDE代理基准上平均提升24%准确率, 并在Long Range Arena上提升2.3点, 解决了固定查询在变输入分布下的泛化限制, 与关键词attention高度契合.
\arxivwithtarget{2608.11532}{Hierarchical Federated Transfer Learning in Digital Twin-Based Vehicular Networks}{Qasim Zia, Saide Zhu, Haoxin Wang, Zafar Iqbal, Yingshu Li}\textbf{cs.LG}, cs.AI.
本文针对Digital Twin-based Vehicular Ad hoc Network (DT-VANET)中联邦学习面临的数据异构性和稀疏性问题, 提出了一种结合联邦迁移学习的层次化联邦迁移学习框架, 并设计了相应的模型更新算法和数据质量评分机制以提升全局模型精度. 实验验证了该方法的有效性, 但方法本身与关键词列表关联较弱.
\arxivwithtarget{2608.11541}{Robust Ambiguity Detection (RAD) From Model- and Feature-Space Consistency}{Manya Singh, Mark T. Keane, Arjun Pakrashi}\textbf{cs.LG}.
本文提出Robust Ambiguity Detection (RAD)框架, 通过模型空间一致性和特征空间一致性两个指标量化预测模糊性, 并利用RAD Plot可视化模糊来源. 该方法在合成和真实数据集上评估, 并展示了基于Pareto排序的弃权应用, 但方法创新性一般, 与关键词关联较弱.
\arxivwithtarget{2608.11555}{Certifying What Helps Customer-Return Timing: A Screen-and-Confirm Test for Conditioning Signals, and Why Decay Is Nearly Enough}{Sang Su Lee, Vineeth Loganathan, Shishir Dash, Vijay Raghavan}\textbf{cs.LG}, stat.AP.
本文提出了一种screen-and-confirm协议, 用于验证候选信号是否真正改善temporal-point-process (TPP)模型的event-timing likelihood, 并通过正控制确认模型能力, 从而将“条件化无帮助”转化为可检验的结论. 作者在多个公开基准和真实市场上证明, continuous-time decay几乎足以预测customer-return timing, 而额外条件化信号冗余或有害, 但方法本身并非开创性突破, 与关键词关联较弱.
\arxivwithtarget{2608.11560}{When Offline Evaluation Misleads: A Diagnostic Protocol for Reward and Policy Selection in Delayed-Feedback Contextual Bandits}{Sang Su Lee, Vineeth Loganathan, Shishir Dash, Vijay Raghavan}\textbf{cs.LG}.
本文提出了一种针对延迟反馈情境下上下文多臂老虎机(CMAB) 的奖励与策略选择的诊断协议, 通过有序检查对齐性和可学习性来避免离线评估的误导. 作者在公开基准和合成数据上验证了该协议, 并应用于实际推送系统, 指出单一离线指标可能错误排序奖励, 且个性化溢价易被高估.
\arxivwithtarget{2608.11567}{Sparse and robust geometric twin support vector machine via asymmetric RoBoSS loss function}{Kai Qi, Xinji Huang, Hongchun Wang}\textbf{cs.LG}.
本文提出了一种基于非对称鲁棒有界稀疏平滑损失函数的$l_1$-范数几何孪生支持向量机(aRSGTSVM) , 用于处理含标签噪声和特征噪声的分类与回归任务, 并通过影响函数分析其鲁棒性, 设计了近端梯度下降求解算法. 实验表明该方法在合成数据和UCI数据集上优于现有方法, 并成功应用于中国股市指数跟踪.
\arxivwithtarget{2608.11572}{RECAST: A Machine-Learning Framework for Correction and Super-Resolution of Coarse-Grid PDE Solvers}{Maryam Reza, Farbod Faraji}\textbf{cs.LG}, physics.comp-ph.
本文提出RECAST框架, 结合循环误差修正与超分辨率重建, 在粗网格PDE求解中恢复精度, 实验显示误差降低50-92%, 但方法为常规机器学习应用, 缺乏开创性.
\arxivwithtarget{2608.11612}{Dion3: Full-Stack Orthogonal Updates}{Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen, Tri Dao, John Langford}\textbf{cs.LG}, cs.AI.
本文提出Dion3, 一种对Muon优化器的全栈式改进, 旨在降低其立方时间Newton-Schulz正交化步骤带来的计算与通信开销. 通过Gram Newton-Schulz算法、利用对称性的CuteDSL内核以及megabatching策略, Dion3在保持与Muon相当或更优的loss表现的同时, 将优化器步进时间最多减少6倍. 此外, 文章引入仅正交化动量矩阵部分行的更新规则, 进一步提升了速度与性能, 可作为Muon的直接替代品.
\arxivwithtarget{2608.11613}{A Local Sinkhorn Framework for Conditional Distribution Reconstruction of Multidimensional Random Fields}{Mingtao Xia, Qijing Shen}\textbf{cs.LG}.
本文提出了一种基于去偏Sinkhorn散度的局部分布匹配框架, 用于训练随机神经网络以重建多维随机场的条件分布, 并给出了泛化误差估计. 该方法在重建精度与计算效率间取得平衡, 适用于不确定性量化.
\arxivwithtarget{2608.11623}{FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting}{Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji}\textbf{cs.LG}, cs.AI, cs.NI, eess.SP.
本文提出FM-LLM框架, 通过Fourier Analysis Network (FAN)将时间序列的spectral特征直接注入冻结的LLM, 实现无文本提示的模态对齐, 避免了传统方法依赖textual prompts带来的计算开销. 其核心创新在于采用constrained asymmetric coupling设计: 共享专家结合轻量FAN层重建全局周期结构, 而路由专家仅使用标准FFN建模非周期残差动态, 并通过time-frequency hybrid loss联合优化时域精度与spectral一致性. 在11个公开基准上, FM-LLM在78项指标中取得59项最优, 相比最强自回归LLM基线平均降低MSE 5.3%和MAE 5.6%, 并在10% few-shot和zero-shot场景下保持优越性能, 为LLM适配时间序列预测提供了新的spectral-aware范式.
\arxivwithtarget{2608.11638}{Transferable Above-Ground Biomass (AGB) Estimation Model from Multi-Sensor Data with Sparse Field Calibration}{Pann Thinzar Seint, Bryan Atwood, Subas Chhatkuli}\textbf{cs.LG}, cs.CV.
本文提出了一种基于多源遥感数据(Sentinel-1/2、ALOS-2 PALSAR-2和DEM) 的全球训练卷积神经网络(CNN) 模型, 用于估算森林地上生物量(AGB) , 并通过少量野外样地数据进行轻量级尺度与偏差校正以适应新区域. 实验表明, 该框架在局部验证中优于未校准的全球模型和ESA CCI产品, 但方法主要为工程性集成与校准流程, 缺乏理论或方法上的开创性.
\arxivwithtarget{2608.11654}{Towards a Formal Definition of Agent Memory: Basis, Span, Optimality, and the Sequential Memory Problem}{Hongyao Tang}\textbf{cs.LG}.
本文提出了一种关于agent memory的形式化定义框架, 将memory视为basis, knowledge视为其span, 并将answerability建模为coverage问题. 作者通过generation operator将事件集转化为知识, 定义最优memory为capacity约束下期望coverage的最大化, 并引入utility-capacity frontier作为比较不同memory系统的统一标准. 该工作还考虑了memory中的噪声, 类比生物记忆的持续形成过程, 在sequential MDP中形式化了continual agent-memory problem, 其中memory为state、writing为action、query-time utility为延迟reward. 通过在Homer的"Odyssey" 上的实例化, 该框架将frontier、compression zone以及coverage与precision的差异转化为具体数值, 为评估和构建agent memory提供了可度量的基础, 与关键词agent和attention(作为query机制) 高度契合.
\arxivwithtarget{2608.11656}{Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models}{Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee}\textbf{cs.LG}.
本文提出了一种名为BLPM的EEG-语言基础模型, 通过连续潜在预测和语义对齐来改进神经解码, 但方法创新性有限, 与关键词列表关联较弱.
\arxivwithtarget{2608.11658}{Is Per-Agent Policy Composition Safe? Rethinking Successor-Feature Transfer in Cooperative Multi-Agent Reinforcement Learning}{Zijian Zhao, Sen Li}\textbf{cs.LG}, cs.AI, cs.MA.
本文针对多智能体强化学习中的successor feature迁移问题, 证明了独立per-agent策略组合(即每个智能体独立重组其策略库) 可能产生比库中所有策略都更差的联合行为, 因为重组队友改变了每个智能体面临的环境, 使其依赖的价值函数失效, 这一失败在单智能体场景中不存在. 作者进一步证明唯一无条件安全的固定规则是同步组合, 但它无法服务给不同智能体分配不同目标的目标函数. 为兼顾安全性与灵活性, 本文提出MA-USFA方法, 采用两层层次结构: 底层为universal successor feature approximators, 在条件于队友目标的情况下预测每个智能体的successor features; 上层组合器跨智能体选择每个智能体应遵循的库条目, 并提供per-agent价值无法表示的跨智能体修正. 该方法在目标分布上训练一次, 部署时无需逐任务适应, 为多智能体迁移学习提供了首个兼具安全性与灵活性的解决方案.
\arxivwithtarget{2608.11661}{Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads}{Zijian Zhao, Sen Li}\textbf{cs.LG}, cs.AI.
本文引入low interaction rank函数类, 以interaction spectrum度量其内在复杂度, 为multiplicative dual-encoder架构(即内积形式的双编码器网络) 提供了统一的理论基础. 在该框架下, 近似误差分解为谱截断项与encoder实现项, 样本复杂度由两个encoder复杂度的和而非积决定, 并基于谱衰减给出架构适用性判据. 文章进一步揭示该架构存在线性gauge对称性导致的identifiability问题, 证明normalization等价于gauge fixing, 而whitening可将interaction modes固定至置换与符号, 从而解释对比学习维度不可解释性并提供构造性修正. 实验在合成核、operator learning与CLIP模型上验证了谱衰减率预测、whitening恢复真实模式, 并发现独立训练的CLIP模型间仅差一个旋转, 去除后暴露可解释概念轴, 与spectral及pretrain关键词高度契合.
\arxivwithtarget{2608.11669}{Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL}{Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu}\textbf{cs.LG}, cs.AI, cs.CL.
本文针对基于rubric的强化学习中的reward hacking问题, 提出了一种简单的Rubric Dropout方法, 通过在训练时随机丢弃部分评分标准来缓解策略对固定代理评分的过度优化, 并在医学和科学基准上验证了其提升OOD泛化性能的效果.
\arxivwithtarget{2608.11674}{GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs}{Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao}\textbf{cs.LG}, cs.AI.
本文提出Principal-Subspace Overlap, 一种维度校正的度量, 用于诊断LLM在rollout RL(如GRPO) 训练中单个更新与预训练权重主导奇异子空间之间的几何关系, 并发现瞬态尖峰往往先于性能退化. 基于此, 作者提出GCPO(Geometrically Constrained Policy Optimization) , 通过对更新施加硬性双侧正交投影以约束其到互补子空间, 从构造上防止此类几何偏移. 在数学推理、代码生成和工具使用任务上, GCPO在Qwen3-8B和GLM4-9B上一致优于GRPO、DAPO和GSPO, 同时消除响应长度膨胀并稳定策略熵, 为RL后训练提供了新的诊断视角和基于spectral几何的设计原则.
\arxivwithtarget{2608.11675}{FunnelCausalNet: Funnel-aware Joint Conversion-Revenue Uplift for Multi-tier Coupon Allocation}{Yu Zhang, Zhihan Wang, Guanlin Chen, Min Jiang, Shuai Li}\textbf{cs.LG}, cs.IR.
本文提出FunnelCausalNet, 一种结合转化与条件价值头的uplift估计器, 用于多层级优惠券分配中的GMV提升. 在RCT数据上通过半合成与工业实验验证其效果, 但方法主要为启发式组合, 缺乏开创性理论突破.
\arxivwithtarget{2608.11690}{Drift and Dependence: Layer-wise Information-Theoretic Bounds for Replay-Based Continual Learning}{Tieliang Gong, Zhongbo Zhang, Wen Wen, Yong-Jin Liu}\textbf{cs.LG}, stat.ML.
本文提出了一种基于层的信息论框架, 用于分析基于回放的持续学习中的泛化误差, 将泛化差距分解为表示漂移和优化依赖项, 并通过Wasserstein松弛和SGLD实例化提供可操作的诊断工具. 实验验证了理论预测, 但方法主要针对持续学习场景, 与关键词关联较弱.
\arxivwithtarget{2608.11691}{LEMUR: Latent Entropy-aware Multimodal Unlearning via Visual-anchored Reasoning Redirection}{Xinhao Zhong, Yuxia Qiao, Junhao Li, Hao Fang, Yi Sun, Bin Chen}\textbf{cs.LG}, cs.CL.
本文提出LEMUR, 一种针对强化学习训练的多模态大推理模型的免训练推理时遗忘框架, 利用token级熵动态识别并重定向敏感推理轨迹, 以抑制隐私泄露. 实验表明该方法在抑制推理痕迹和答案泄露上优于现有遗忘方法, 同时保持非敏感效用.
\arxivwithtarget{2608.11698}{REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation}{Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan}\textbf{cs.LG}, cs.AI.
本文提出REOPD框架, 通过结合token级兼容性权重与batch级自适应预算, 为on-policy distillation中的reward extrapolation方法提供逐token系数调整, 以缓解reward hacking并提升训练稳定性. 实验表明REOPD在数学与代码任务上表现优于或匹配现有方法, 但方法本质为工程性改进, 缺乏理论开创性.
\arxivwithtarget{2608.11701}{Consolidator: Learning Persistent Routed Memory Across Context Boundaries}{Sungwoo Goo, Hwi-yeol Yun, Sangkeun Jung}\textbf{cs.LG}, cs.AI.
本文提出Consolidator机制, 在Phasor Memory Network中通过共享slot-local算子将短期记忆转换为长期记忆, 并在两段式modulo-10映射任务上验证其有效性. 实验表明该机制能提升更新映射的召回率, 但方法较为特定, 与关键词契合度有限.
\arxivwithtarget{2608.11704}{Robust and Efficient Noisy-Label Time-Series Classification via Dynamic Time Warping Based Granular Ball Computing}{Ziqiang Li, Yun Liu, Gouhei Tanaka}\textbf{cs.LG}, cs.AI.
本文提出基于Dynamic Time Warping (DTW)的Granular Ball Computing方法(DTW-GBC), 通过将时间序列训练样本组织成粒球并在粒级进行分类, 以缓解标签噪声对DTW-based Nearest-Neighbor分类器的影响, 同时减少推理时的DTW计算量. 实验表明该方法在对称标签噪声下能保持分类鲁棒性并提升推理效率.
\arxivwithtarget{2608.11713}{High-dimensional Multi-objective Bayesian Optimization with Learned Variable Interactions}{Hongyan Wang, Jiayu Huang, Haotian Zheng, Xin Gao, Chi Ding, Ying Liu, Xia Wang, Qing Xu, Keqiang Li}\textbf{cs.LG}, cs.AI.
本文提出了一种基于变量交互分析的高维多目标贝叶斯优化框架ViaMOBO, 通过分析决策变量间的独立或依赖关系将高维决策空间分解为子空间, 并在子空间中进行局部贝叶斯优化, 以缓解高维采样复杂度问题. 实验表明该方法在合成和真实基准上优于现有MOBO方法, 但未涉及关键词相关方向.
\arxivwithtarget{2608.11716}{Chain-of-Thought Shows the Path to a Tree: Realizing Branching Complexity}{Debanjan Dutta, Anish Chakrabarty, Swagatam Das}\textbf{cs.LG}.
本文通过显式的深度有界构造, 为Chain-of-Thought (CoT)在分支复杂度上的表达能力提供了具体实现. 作者给出了至多两层hard-attention decoder对depth-first search (DFS)和Dijkstra算法的CoT实现, 并以此作为共享计算基板, 分别用四层和三层decoder在$2n-1$和$n-1$步内计算$n$顶点树的Strahler number和width. 由于计算二叉树的Strahler number是$\textsf{NC}^1$-complete问题, 且构造无需layer normalization或positional encodings, 这为CoT层次结构的线性步数机制提供了非平凡证据, 并利用有序树与Dyck路径的经典双射给出了路径表示上的独立构造.
\arxivwithtarget{2608.11746}{Epiplexity Guided Data Selection and Generation for Out-of-Distribution Generalization}{Ellen Su, Andres Potapczynski, Shikai Qiu, Edward Hughes, Andrew Gordon Wilson}\textbf{cs.LG}, cs.CL.
本文提出利用epiplexity(一种衡量计算受限学习者从数据中提取结构信息的指标) 作为在线训练信号, 用于数据选择和合成数据生成, 以提升模型的out-of-distribution泛化能力. 实验表明, 高epiplexity数据能改善zero-shot和fine-tuning性能, 但方法主要针对数据筛选, 与关键词关联较弱.
\arxivwithtarget{2608.11749}{MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning}{Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun}\textbf{cs.LG}, cs.AI, stat.ML.
本文提出MOON (Multi-Objective OrthoNormalized Updates)方法, 针对多任务学习中的多目标优化问题, 指出在欧氏空间中进行梯度操纵并非矩阵几何下的最速下降方向, 从而限制了优化效率. 该方法基于谱-核范数几何(spectral-nuclear norm geometry) 执行梯度操纵, 并使用正交归一化后的操纵梯度进行参数更新, 理论证明在光滑非凸目标下, 确定性设置中Pareto-stationarity测度的平均收敛率为$\mathcal{O}(T^{-1/2})$, 随机梯度下为$\mathcal{O}(T^{-1/4})$. 实验表明MOON在多个基准上一致提升优化效率与最终多任务性能, 其核心思想与关键词中的spectral和Muon(一种基于正交化更新的优化器) 高度契合, 具有方法上的开创性.
\arxivwithtarget{2608.11785}{TradingMoE: Routing the Right Experts in Evolving Markets}{Chang Zhou, Xingtong Yu, Minbin Huang, Zhennan Wu, Yuan Fang, Hong Cheng, Xinming Zhang}\textbf{cs.LG}.
本文提出TradingMoE, 一种面向交易的稀疏Mixture-of-Experts模型, 通过Query-Key router和稀疏专家选择更新机制, 在股票和加密货币市场上提升了累计收益, 但方法主要针对金融交易场景, 与关键词契合度有限.
\arxivwithtarget{2608.11790}{High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving}{Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf}\textbf{cs.LG}.
本文提出一种基于高阶液体证据编码的GNSS欺骗检测方法, 通过构造GNSS与车载运动的不一致性残差及其一阶、二阶离散变化作为证据流, 并利用自适应液体编码器进行时序建模. 实验在AV-GPS数据集上验证了其有效性, 但方法主要针对特定应用场景, 创新性有限.
\arxivwithtarget{2608.11797}{Orientation, not magnitude: the causal structure of task-vector interference in merged language models}{Chencheng Zhu}\textbf{cs.LG}.
本文通过因子化账本和直接干预, 研究了合并语言模型中任务向量干扰的因果结构, 发现幅度不足以作为诊断轴, 而方向具有因果重要性. 研究基于预注册的46项预测, 报告了包括自身预期在内的证伪结果, 但未涉及关键词列表中的特定主题.
\arxivwithtarget{2608.11801}{JAPE: Joint Anomaly Prediction and Intrinsic Explanation in Multivariate Time Series}{Yian Wei, Yuanyuan Yao, Lu Chen, Xiangmin Zhou, Tianyi Li}\textbf{cs.LG}.
本文提出JAPE框架, 将多变量时间序列异常预测从数值偏差建模提升至依赖结构建模, 通过解耦时空表示和双视角告警机制实现预测, 并利用预测的依赖图进行变量级解释. 实验表明其在多个基准上提升了F1和AUC-PR指标.
\arxivwithtarget{2608.11815}{Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks}{Yaohua Liu, Yifan Guo, Jiaxin Gao}\textbf{cs.LG}, cs.CV.
本文从bilevel-minimax视角重新审视基于迁移的黑盒对抗攻击问题, 提出BMAT方法, 通过结合Soft Weight Modulator和Implicit Gradient Approximator实现初始化、代理模型适应与扰动优化的三元耦合, 并在分类与分割基准上验证了其有效性.
\arxivwithtarget{2608.11829}{Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling}{Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao}\textbf{cs.LG}, cs.CL.
本文通过test-time scaling的视角, 研究了on-policy distillation (OPD)对LLM推理能力的影响, 发现OPD主要提升采样效率而非扩展推理能力边界, 并揭示了其“illusory distillation”的特性.
\arxivwithtarget{2608.11831}{Kernel Methods for Learning Operators with Multiple Inputs and Outputs}{Adrien Weihs, Chunyang Liao, Jingmin Sun, Hayden Schaeffer}\textbf{cs.LG}, math.ST, stat.ML.
本文提出了一种通用的基于kernel的encoder-decoder框架用于多输入多输出算子学习, 并引入KernelMO方法族, 在多个参数化PDE族上取得了有竞争力的预测精度, 同时降低了训练和推理成本.
\arxivwithtarget{2608.11839}{Air Quality Station Simulation via LSTM and Attention-Based Modelling}{Alexander Kostadinov, Petar O. Hristov, Dessislava Petrova-Antonova}\textbf{cs.LG}.
本文提出了一种基于LSTM和attention机制的深度学习模型SATADL, 用于模拟城市空气质量监测站点的PM10浓度数据, 以应对设备故障导致的数据缺失问题. 模型在多个国际站点数据上进行了长达48小时的模拟测试, 并优于多种baseline模型, 但方法本身属于现有技术的组合应用, 缺乏开创性.
\arxivwithtarget{2608.11859}{Small-Scale Experiments: Are We There Yet?}{Nicholas Lourie, Kyunghyun Cho, Karen Ullrich, Sanae Lotfi}\textbf{cs.LG}.
本文探讨了scaling laws在小规模实验中的可靠性问题, 指出超参数敏感性是导致小模型预测失效的关键因素, 并提出了新的方法论以从中小规模实验恢复大规模结论. 研究涉及模型规模与超参数调优的相互作用, 但未直接涉及关键词中的核心主题.
\arxivwithtarget{2608.11868}{Forward and Inverse Virtual Metrology for Phototransistor Gain: A Hierarchical, Uncertainty-Aware Approach for Small Production Datasets}{Mahshid Amirabgir, Lorenza Ferrario, Paolo Conci, Mahdieh Amirabgir, Giancarlo Orengo}\textbf{cs.LG}, cs.CE, eess.SY.
本文针对硅双极光电晶体管增益预测问题, 提出了一种面向小样本分层生产数据的虚拟量测方法, 包括前向增益预测、逆向工艺参数搜索及多层级数据质量评估, 并基于真实制造历史验证了其有效性.
\arxivwithtarget{2608.11873}{DCM Bandits: Multiplayer Information Asymmetric Cascading Bandits for Multiple Clicks}{Andy Wang, Charlton Shih, William Chang}\textbf{cs.LG}.
本文研究了多智能体信息不对称场景下的DCM Bandits问题, 扩展了Dependent Click Model到多玩家共享排名列表且每会话多次点击的设置, 并针对动作和奖励不对称性提出了亚线性遗憾保证算法. 实验验证了算法在不对称环境中的有效性, 并强调了反馈结构对协调探索的重要性.
\arxivwithtarget{2608.11909}{Disentangling the Expressivity of RoPE}{Selim Jerad, Anej Svete, Jiaoda Li, Ryan Cotterell}\textbf{cs.LG}, cs.FL.
本文形式化分析了旋转位置编码(RoPE) 在有限精度soft-attention transformer中的表达能力, 区分了周期性旋转与常规非周期旋转的差异, 并通过实验验证了周期性调度在模语言上的长度泛化优势. 该工作为RoPE的理论表达性提供了更贴近实际模型的刻画, 但未直接涉及关键词中的核心主题.
\arxivwithtarget{2608.11917}{A Factor Graph Approach to Scalable Multi-Output Gaussian Process Regression}{Wouter W. L. Nuijten, Esther G. van Pelt, Albert Podusenko, İsmail Şenöz, Wouter M. Kouw}\textbf{cs.LG}.
本文提出了一种基于Forney-style factor graph的多输出Gaussian process regression方法, 通过nearest-neighbor chain将候选输入排序, 利用线性Gaussian transition factors和linear model of coregionalization实现高效推理, 计算复杂度为$\mathcal{O}(C(DL^2 + L^3))$. 实验表明该方法在低维输入下接近精确kernel-matrix方法, 并在时间序列预测中保持竞争力, 但方法本身并非开创性突破, 与关键词关联较弱.
\arxivwithtarget{2608.11937}{Distillation of Foundation Models for Time-dependent PDEs}{Daniel Musekamp, Boshra Ariguib, Andrei Manolache, Mathias Niepert}\textbf{cs.LG}.
本文提出TREX框架, 通过教师模型滚动生成合成轨迹来蒸馏预训练基础模型到紧凑学生模型, 在保持精度的同时大幅减少参数和推理时间. 该方法适用于时间依赖PDE的低数据场景, 但未涉及关键词中的核心概念.
\arxivwithtarget{2608.11951}{TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement}{Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra}\textbf{cs.LG}, cs.AI.
本文提出TailBooster, 一种双层生成框架, 结合生成模型与两层异常检测, 用于增强航空运输中的极端事件数据, 并确保生成记录的操作可行性. 实验表明该方法在极端事件预测上优于传统合成数据方法, 但方法本身为工程性组合, 缺乏理论开创性, 且与关键词关联较弱.
\arxivwithtarget{2608.11967}{LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation}{Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang}\textbf{cs.LG}, cs.AI.
本文提出LoongReflect训练框架, 将搜索agent中的反思形式化为基于可逆轨迹树的memory-control policy, 结合全局教师蒸馏与GRPO优化以解决局部反思与全局结果不匹配的问题. 实验显示其在多跳检索增强生成和数学推理任务上优于基线, 但方法主要为工程性改进, 与关键词契合度有限.
\arxivwithtarget{2608.11970}{TESLA: Taylor Expansion of Sinusoidal Learnable Activations}{Daehwa Ko, Jaehyeon Kim, Seunghyun Ham, Jay Hoon Jung}\textbf{cs.LG}.
本文提出TESLA激活函数, 通过可学习的正弦与余弦项组合实现对多项式阶数的显式控制, 并选择性放大高阶分量. 理论上, 作者证明约束TESLA系数可得到Lipschitz/Rademacher复杂度界, 并塑造训练动态以强调高频结构. 实验上, 在输入长度n=32的parity问题上, TESLA仅用100K训练样本(约占$2^{32}$输入空间的0.002%) 即实现强泛化, 且在30%标签噪声下保持高精度, 同时与SIREN、SNAKE和Fourier feature embeddings等基线在parity和Forrelation任务上对比, 并在ImageNet-100上取得可比性能, 表明激活级阶数控制可迁移至通用视觉任务. 该方法为处理线性不可分和全局交互问题提供了新的激活设计思路, 与关键词中的spectral和context有一定契合.
\arxivwithtarget{2608.12001}{Remote Sensing and Machine Learning-Based Analysis of Land Use and Vegetation Change in Dhaka District, Bangladesh}{Muhammad Masud Tarek, Md. Alamgir Hossain, Md. Samiul Islam, Muntasir Hasan Kanchan}\textbf{cs.LG}, cs.AI, cs.CV.
本文利用Sentinel-2和Landsat 8遥感影像及机器学习分类器(Decision Tree、KNN、Random Forest) 分析了2019至2024年达卡地区的土地利用与植被变化, 发现城市建成区显著扩张而植被和水体减少. 研究展示了遥感与机器学习在城市环境监测中的应用潜力.
\arxivwithtarget{2608.12007}{Dual-Model Sentiment Analysis of Consumer Reviews in the Retail Coffee Sector Using Machine Learning and Deep Learning Approaches}{Muntasir Hasan Kanchan, Md. Alamgir Hossain, Md. Samiul Islam, Muhammad Masud Tarek}\textbf{cs.LG}, cs.AI, cs.CV.
本文对Starbucks消费者评论进行了情感分析, 比较了五种机器学习模型和五种深度学习模型的性能, 发现SVM和Bidirectional LSTM分别表现最佳, 并指出类别不平衡对模型的影响. 研究为零售咖啡行业的消费者体验分析提供了模型选择参考.
\arxivwithtarget{2608.12010}{Reducing Symmetry Increase in Equivariant Neural Networks}{Ning Lin, Jiacheng Cen, Anyi Li, Wenbing Huang, Hao Sun}\textbf{cs.LG}.
本文研究了等变神经网络(ENN) 在处理对称输入时出现的对称性增加现象, 证明了该增加存在由特征空间结构决定的下确界, 并提出了可计算算法与特征设计准则以抑制有害的对称性增加, 最后通过合成数据与QM9数据集实验验证了理论结果.
\arxivwithtarget{2608.12026}{SoftWater: Class-Aware Rate Allocation for Softmax Quantization}{Joao V. Cavalcanti, Ashia C. Wilson}\textbf{cs.LG}.
本文提出SoftWater方法, 将softmax层量化建模为KL散度下的率失真问题, 利用类感知几何和可分离近似实现高效量化, 在多个LLM上显著降低头部存储开销并保持性能. 该方法与关键词列表中的概念关联较弱.
\arxivwithtarget{2608.12027}{Uncertainty-Aware Probabilistic Constrained Clustering from Entangled Pairwise Supervision}{Shaojie Zhang, Ke Chen}\textbf{cs.LG}, cs.AI.
本文提出了一种不确定性感知的概率约束聚类方法, 通过估计和校正软标签来处理纠缠的成对监督, 并构建了ECI-PP框架以提升聚类性能. 该方法在多种基准上优于现有深度约束聚类方法, 但与我提供的关键词关联较弱.
\arxivwithtarget{2608.12037}{Clustered Randomized Smoothing for Stochastic Prediction Functions}{Eduardo Figueiredo, Frederik Mathiesen, Julian Schumann, Jens Kober, Arkady Zgonnikov, Luca Laurenti}\textbf{cs.LG}, eess.SY.
本文提出clustered $\alpha$-smoothing框架, 通过聚类噪声样本并局部应用$\alpha$-smoothing来改进随机平滑在随机多模态回归中的鲁棒性, 并在轨迹预测和四旋翼控制任务上验证了性能提升.
\arxivwithtarget{2608.12057}{Towards Truly Unsupervised Evaluation of Feature Selection}{Hafiz Saud Arshad, Muhammad Rajabinasab, Arthur Zimek}\textbf{cs.LG}.
本文批判了现有无监督特征选择评估方法的设计缺陷, 指出其本质上是监督评估, 并提出一种基于无监督Principal Component Analysis和optimal transport的新框架, 以在无标签信息下衡量特征选择算法的质量.
\arxivwithtarget{2608.12083}{Faithful, Sufficient and Understandable: Rethinking Graph Counterfactual Explanations via Discrete Diffusion Inversion}{David Bechtoldt, Sidney Bender}\textbf{cs.LG}, cs.AI.
本文提出了一种基于离散扩散模型反演的图反事实解释方法GDCE-I, 通过新颖的离散反演方案在保持数据流形的同时覆盖完整编辑空间, 并构建了统一的解释评估框架. 实验表明该方法在多个基准上优于现有工作, 但方法本身与关键词列表关联较弱.
\arxivwithtarget{2608.12084}{NAE: Normalizing AutoEncoder}{Muhammad Abdur Rafae, Niels Landwehr}\textbf{cs.LG}.
本文针对Normalizing flows with approximate inverses(即flow autoencoders) 的训练动态进行了理论分析, 证明了现有方法所采用的损失函数是次优的, 并指出编码器和解码器的代理损失必须与重建损失对齐. 基于此, 作者提出Normalizing Autoencoder (NAE), 通过一种新颖的条件损失使代理损失梯度与重建损失梯度一致, 从而直接改进了现有标准. 实验表明NAE在分子生成、表格数据和图像基准上达到state of the art性能, 强调了损失对齐在flow autoencoders中的重要性, 为生成模型框架提供了新的理论指导.
\arxivwithtarget{2608.12090}{Task- and dataset-specific information in protein language models}{Roman Joeres, Ilya Senatorov, Olga V. Kalinina}\textbf{cs.LG}, q-bio.BM.
本文分析了13种蛋白质语言模型(PLMs) 在15个下游任务中的中间层嵌入信息量, 发现最后一层嵌入并非最优, 且任务类型与数据集特性(如深度突变扫描数据或天然蛋白多样性) 影响信息分布层. 研究还指出PLMs在人工蛋白任务上性能显著下降, 但未涉及关键词中的code、context、spectral、Muon、pretrain、agent或attention等核心概念.
\arxivwithtarget{2608.12100}{Confidence Calibration of Deep Learning Systems}{Coby Penso}\textbf{cs.LG}, cs.AI, stat.ML.
本文研究了深度学习系统在标签噪声、无监督域适应和隐私保护等复杂条件下的置信度校准问题, 提出了基于噪声模型重构、目标域精度估计和本地差分隐私的校准方法, 并扩展至Conformal Prediction框架.
\arxivwithtarget{2608.12108}{Beyond Parameter Space: NTK-Guided Personalized Aggregation for Robust Federated Learning}{Mirko Konstantin, Stefan Zachow, Anirban Mukhopadhyay}\textbf{cs.LG}.
本文提出LIGHTYEAR框架, 利用Neural Tangent Kernel (NTK)在function space中评估客户端更新的预测行为, 通过peer-to-peer拓扑实现个性化聚合, 以应对联邦学习中的non-IID数据异构性. 实验表明其在多个数据集上优于现有方法, 但方法本质是联邦学习中的聚合策略改进, 与关键词列表关联较弱.
\arxivwithtarget{2608.12117}{Attractor Image-Based Deep Learning of Arterial Pulse Waves for Age Classification}{Sara Vardanega, Patrick Segers, Philip Aston, Ernst Rietzschel, Jordi Alastruey, Manasi Nandi}\textbf{cs.LG}.
本文利用Symmetric Projection Attractor Reconstruction (SPAR)方法将动脉脉搏波时间序列转换为图像, 并训练卷积神经网络对健康成年人的年龄进行分类, 在内部和外部测试集上均取得F1分数超过70%的结果. 该研究为基于可穿戴设备的早期心血管风险检测提供了概念验证, 但方法本身并非开创性突破.
\arxivwithtarget{2608.12134}{Adversarial Resilience of Poisson-Process Submodular Maximization over Matroids: From Robust Offline Optimization to Full-Bandit Learning}{Vaneet Aggarwal}\textbf{cs.LG}, cs.AI, cs.CC, math.OC.
本文研究了在一般matroid约束下, 非负submodular maximization问题在受控value oracle下的对抗鲁棒性, 证明了Spiteful Greedy Swap Poisson Process算法在保持近似因子$1/e$和$1-1/e$的同时, 对oracle误差具有鲁棒性, 并由此推导出全bandit学习算法的regret界.
\arxivwithtarget{2608.12194}{HYDRA: Hyperbolic Dynamic Representation Architecture for Kolmogorov-Arnold Networks}{Zhao Su, Yuxin Xia, Haoran Li, Jun Shen, Qi Zhu, Qingguo Zhou, Binbin Yong}\textbf{cs.LG}, cs.AI.
本文提出HYDRA, 一种基于双曲空间的参数高效Kolmogorov-Arnold Network变体, 通过低秩原型块共享函数变换以减少参数冗余, 并在多个基准数据集上验证了其性能与可解释性.
\arxivwithtarget{2608.12219}{ScreenShot: A Foundation Model for Few-Shot Combination Drug Screening}{Antoine de Mathelin, Christopher Tosh, Wesley Tansey}\textbf{cs.LG}.
本文提出ScreenShot, 一个基于hierarchical transformer的预训练模型, 用于少样本组合药物筛选, 通过in-context learning直接预测新患者的药物组合反应, 无需分子谱分析或微调. 模型在多个数据集上优于基线, 并利用内部表示驱动主动学习策略以降低实验成本.
\arxivwithtarget{2608.12231}{An Efficient Near-Optimal Algorithm for Adversarial $m$-Set Bandits}{Francesco Bacchiocchi, Tommaso Cesari, Roberto Colomboni}\textbf{cs.LG}.
本文提出了一种针对对抗性$m$-set bandits问题的高效近最优算法, 其中每轮学习者从$d$个物品中选择$m$个并仅观察所选物品的聚合损失. 该算法通过仅用$d$个参数表示每个采样分布, 避免了显式枚举大小为$K=\binom{d}{m}$的指数级动作集, 从而在多项式时间内运行. 针对自适应非预期对手, 算法以至少$1-\delta$的概率实现了与最优固定动作相比的遗憾界$R_T = O(\sqrt{dT\log(K/\delta)})$, 匹配了Zimmert和Lattimore的EXP3-KW算法的高概率遗憾界, 同时解决了Maiti等人提出的开放问题. 该工作为组合bandits领域提供了计算效率与统计最优性兼顾的突破性方法.
\arxivwithtarget{2608.12259}{Calibration Bets on the Past: Post-Training Quantization for Financial Time-Series Forecasting}{Junyi Ye, Ivy Gateri Wanjiku}\textbf{cs.LG}, q-fin.ST.
本文系统研究了金融时间序列预测中后训练量化(PTQ) 的激活校准问题, 基于S&P 500横截面波动率预测评估了七种神经网络架构和560个训练模型. 研究发现激活校准在8位量化下影响甚微, 但在4位量化下成为预测性能的主要决定因素, 且最优激活范围随市场周期变化. 该工作为金融部署中的量化选择提供了实证指导, 但方法本身缺乏开创性, 与关键词关联较弱.
\arxivwithtarget{2608.12271}{Earth observation embeddings are effective sub-grid descriptors for probabilistic weather downscaling}{Pedro Sousa, Will Tebbutt, Sadiq Jaffer, Robin Young, Anil Madhavapeddy, Richard E. Turner}\textbf{cs.LG}, physics.ao-ph.
本文利用TESSERA地球观测嵌入作为局部地表描述符, 增强卷积条件神经过程以实现概率天气降尺度, 在多个气候区域提升了2米温度和10米风速的预测技能. 研究表明长期地表嵌入可辅助短期降尺度, 但方法主要依赖现有模型组合, 创新性有限.
\arxivwithtarget{2608.12302}{A Framework for Designing Reward Functions: From Objectives to Features to Human-Aligned Reward Functions}{Di Yang Shi, W. Bradley Knox}\textbf{cs.LG}.
本文提出了一种面向非专家的奖励函数设计框架, 通过三步流程(目标分解、因果变量选择、权重拟合) 生成符合偏好排序的线性奖励函数, 并将变量选择问题转化为最小成本部分覆盖问题, 权重拟合视为凸可行性问题. 该方法在奖励设计领域提供了一种系统化流程, 但与关键词列表中的主题关联较弱.
\arxivwithtarget{2608.12306}{Redistribution-based Cost Inference Improves Sparse Safe Offline RL}{Ebenezer Gelo, Geraud Nangue Tasse, Steven James, Benjamin Rosman}\textbf{cs.LG}, cs.AI.
本文提出Redistribution-based Cost Inference (RCI)框架, 将稀疏的轨迹级stop-feedback转化为稠密的每步成本, 用于安全offline RL, 并证明该转化在CMDP中保持可行策略集和最优Lagrangian. 实验显示其违规率低于基线, 但方法主要为工程性改进, 缺乏开创性且与关键词关联较弱.
\arxivwithtarget{2608.12307}{AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses}{Cheng Qian, Wenting Zhao, Liangwei Yang, Heng Wang, Jielin Qiu, Heng Ji, Silvio Savarese, Huan Wang, Shelby Heinecke}\textbf{cs.LG}, cs.AI, cs.CL.
本文提出了一种测试时(test-time) 的强到弱能力迁移方法, 通过让更强的builder模型构建推理时harness(一种推理时脚手架或辅助框架) 来提升较弱target模型的性能, 而无需更新target模型的参数. 在四个Theory-of-Mind基准上, 该方法将平均性能从0.49提升至0.91, 且增益主要来源于将不稳定的模型推理卸载到确定性代码、基准特定路由和严格答案格式约束, 而非鼓励更长的推理或更广泛的采样. 该工作为能力迁移提供了训练时蒸馏之外的重要补充, 与关键词中的agent和code高度契合, 具有方法上的开创性.
\section{cs.AI}
\arxivwithtarget{2608.08514}{Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing}{Minhan Cho, Jimin Kweon}\textbf{cs.AI}, cs.CL, cs.LG.
本文独立复现了两种提升大语言模型推理可靠性的方法(RPC和LCF) , 并在多个新任务域和模型上进行了压力测试. 结果表明RPC的优势不显著, LCF的逻辑编辑效果较弱且不稳定, 对原方法的可靠性提出了质疑.
\arxivwithtarget{2608.11207}{Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes}{Alexander Liss, Nicholas Desmond, Santiago Gil Gallego}\textbf{cs.AI}.
本文提出了一种用于多LLM智能体对话系统的控制层框架(Experience Orchestrator) , 通过Contextual Bandit、PID控制器和POMDP信念追踪器来协调具有对立目标的智能体交互, 在模拟金融环境中提升了高意图转化率. 该工作主要关注agent交互的工程化治理, 与关键词中的spectral、Muon等理论方法关联较弱.
\arxivwithtarget{2608.11210}{Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration}{Patrik P. Süli, György Eigner, Roland Hollós}\textbf{cs.AI}, cs.MA, cs.SE.
本文介绍了一个名为Distribird的agentic web application, 用于自动化贝叶斯模型校准中的先验分布设计, 通过多agent pipeline从文献中提取参数值并拟合概率分布. 该工具在24个参数上的评估显示其先验质量与单提示LLM基线相当, 但更注重可追溯性和本地运行, 与关键词关联较弱.
\arxivwithtarget{2608.11211}{A Forced-Structure Reduction and Verifiable Bounds for Conway's 99-Graph}{Aalok Thakkar}\textbf{cs.AI}, cs.SC, math.CO.
本文通过自主AI研究代理系统, 对Conway's 99-graph问题(即是否存在参数为$\mathrm{srg}(99,14,1,2)$的强正则图) 进行了系统性攻击, 给出了可验证的边界结果. 作者证明了循环图在$\mathbb{Z}/99$上最多满足$68.0\%$的约束, 并提出了forced-structure reduction方法将问题转化为12-正则图的存在性, 同时验证了若干自动机框架. 该工作主要贡献在于计算验证与边界探索, 但未解决该长期开放问题, 且方法本身缺乏开创性.
\arxivwithtarget{2608.11212}{Detecting a Route Flip Is Easier Than Knowing Whether to Fix It: Causal Route-Mediated Damage in Quantized Mixture-of-Experts}{Parvel Gu}\textbf{cs.AI}, cs.CL, cs.LG.
本文研究了Top-k Mixture-of-Experts (MoE)路由不连续性导致的量化损伤问题, 通过因果装置量化了路由介导的损伤分数(RMF) , 并发现可部署的路由器边际能检测路由翻转但无法预测其损失符号. 实验在多个架构上验证了该检测-修复能力的不对称性, 但未提出新的缓解方法.
\arxivwithtarget{2608.11215}{Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop}{Igor Itkin}\textbf{cs.AI}, cond-mat.stat-mech, cs.CL, cs.LG, cs.MA, physics.soc-ph.
本文提出了一种在笔记本电脑上模拟大规模LLM智能体社会的低成本方法, 通过用低参数模型替代每个LLM智能体, 并引入交互顺序与记忆的分类法来预测替代误差趋势, 在多个模拟中验证了其有效性.
\arxivwithtarget{2608.11216}{AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research}{Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri}\textbf{cs.AI}.
本文提出了AutoWorldModel-Bench, 一个用于评估AI coding agents在world-model研究中进行自主改进的闭环benchmark, 涵盖八个游戏环境并采用统一的结构化状态表示. 实验表明前沿agents能在多数会话中实现非平凡的研究式改进, 但该工作主要聚焦于benchmark设计和agent评估, 与关键词中的spectral、Muon、pretrain等核心主题关联较弱.
\arxivwithtarget{2608.11218}{MaSRead: Content-Addressed Reading of Replicated Latent Stores}{Carlos Baquero, Luís Brito, João Resende}\textbf{cs.AI}, cs.LG, cs.MA.
本文提出MaSRead方法, 通过内容寻址机制在复制的潜在存储(latent store) 中读取缓存片段, 利用图遍历和硬注意力掩码实现多跳查询的片段恢复, 但方法依赖词汇连通性且受限于冻结的reader模型.
\arxivwithtarget{2608.11219}{From Monolithic to Modular: Segment-level Automatic Prompt Optimization}{Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova}\textbf{cs.AI}, cs.CL, cs.LG.
本文提出SAPO, 一种将prompt分解为role、context、tasks和output format的segment-level自动优化方法, 通过top-5和bottom-5示例进行针对性改进. 实验在多个数据集上对比多种APO基线, SAPO取得平均最优性能, 但方法本质为工程性改进, 缺乏理论或方法论上的开创性.
\arxivwithtarget{2608.11220}{LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs}{Timur Zakarin, Sergei Voitov, Sergei Shumilin, Evgeny Burnaev}\textbf{cs.AI}, cs.MA.
本文提出P&ID Pilot, 一个结合遗传算法与大语言模型的端到端AI流程, 用于自动生成和转换工艺流程图(PFD) 为管道仪表图(P&ID) , 并验证了混合方法在拓扑优化中的有效性. 该工作主要面向工程自动化应用, 与关键词中的agent有一定关联, 但方法创新性有限.
\arxivwithtarget{2608.11221}{A Conceptual Framework for Refining Influence Knowledge from Simulation Evidence in Cyber-Physical Systems}{Barbara da Silva Oliveira, Julien Deantoni, Nicolas Ferry}\textbf{cs.AI}.
本文提出一个概念框架, 利用Influences概念支持CPS仿真活动的迭代细化, 以理解环境介导的交互行为, 并通过移动机器人Simulink/Gazebo协同仿真案例展示其应用.
\arxivwithtarget{2608.11224}{Harnessing agent memory to build lifelong AI partners for materials scientists}{Siyu Liu, Bo Hu, Beilin Ye, He Cao, David J. Srolovitz, Tongqi Wen}\textbf{cs.AI}, cond-mat.mtrl-sci, cs.CE, cs.CL, cs.MA.
本文提出了一种基于持久记忆的自进化框架, 将材料科学中的科学经验存储为可检查的事实和可执行的技能, 使观察、失败边界、协议和验证检查能够跨模型检索、修订和迁移. 该框架在49个真实材料工具使用问题(含138个可执行子任务) 中, 使GPT-5.2的任务成功率近乎翻倍且无需更新模型参数; 在元素固体状态方程计算中, 将波函数初始化失败转化为执行前防护栏, 将Correct/Partial/Error结果从22/1/4改善至25/2/0, 并避免了92%的重复错误. 在13个实际材料模拟工作流中, 记忆技能和失败事实将累计token负担减半, 工具调用次数在第三轮减少超过两倍, 同时保持带隙、声子、空位和功函数分析的物理意义. 该工作与关键词中的agent高度契合, 展示了agent memory作为持久科学资产的价值, 为材料科学中的终身AI伙伴提供了开创性设计思路.
\arxivwithtarget{2608.11225}{Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones}{Luc E. Brunet}\textbf{cs.AI}.
本文提出一个关于AI人格克隆的概念框架, 从外部观察者的角度通过不可区分性来定义身份, 并区分了保真度、类人性和个体性三个标准. 文章还引入了一个六项因子分解和状态空间表述, 并讨论了克隆的版本性对长期不可区分性的影响, 但整体属于理论性探讨, 与关键词关联较弱.
\arxivwithtarget{2608.11226}{Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet}{Eliseo Curcio}\textbf{cs.AI}, eess.SY.
本文通过强化学习(PPO meta-controller) 控制LLM训练(GRPO) 的GPU功耗, 在7B至72B规模上测量并优化了功耗限制违规与能效, 但方法主要针对特定硬件与工作负载, 缺乏广泛开创性, 且与关键词(如code, spectral, Muon等) 关联较弱.
\arxivwithtarget{2608.11227}{Forecasting Side Effects of Activation Steering}{Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun}\textbf{cs.AI}, cs.LG.
本文通过构建跨效应矩阵, 研究了激活导向(activation steering) 在语言模型中的副作用预测问题, 发现副作用普遍存在且具有结构性和不对称性, 并证明其方向和大小可在导向前从模型表示中预测. 该工作为安全审计提供了工具, 但与关键词列表关联较弱.
\arxivwithtarget{2608.11229}{Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version)}{Jack Mirenzi, Henny Admoni}\textbf{cs.AI}, cs.RO.
本文探讨了在人机协作团队中通过二阶心理理论同步信念的问题, 将偏好学习重新建模为教师与学习者之间的耦合行为模型, 并在模拟中验证了知情教师和结构化反馈的优势. 该研究与关键词列表中的概念关联较弱.
\arxivwithtarget{2608.11230}{The Edge-based Contiguous p-median Problem with Connections to Logistics Districting}{Zeyad Kassem, Adolfo R. Escobedo}\textbf{cs.AI}, cs.DM.
本文提出edge-based contiguous p-median (ECpM)问题, 用于将网络中的道路划分为给定数量的紧凑且连续的territories, 并构建了两种binary programming模型(基于cut set约束和基于shortest-path约束) 及其求解算法. 实验表明基于shortest-path contiguity (SPC)约束的模型在计算速度上显著优于cut set-based branch-and-cut方法, 并探讨了与edge-based districting问题的联系.
\arxivwithtarget{2608.11231}{LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs}{Yirui Liu, Ruoling Qi, Longwen Wang, Xuaner Wu, Jian Chen, Yuxin Jin, Jiawei Shao, Xuelong Li}\textbf{cs.AI}.
本文提出LinearKV, 一种针对混合LLM(hybrid LLM) 的无训练位置无关缓存(PIC) 框架, 通过解耦初始化使线性层仅需单个缓存状态即可恢复大部分质量, 并证明精确组合所有缓存状态(如HYPIC) 在部分架构上不必要甚至有害. 实验表明该方法在多个混合模型上性能与全量预填充接近, 且降低首令牌延迟.
\arxivwithtarget{2608.11234}{InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk}{Yuan Gao, Zeren Yang, Junnan Li, Shawn, Zhong, Ahmed Dajani, Mai Zheng, Andrea Arpaci-Dusseau, Remzi Arpaci-Dusseau}\textbf{cs.AI}, cs.OS.
本文提出了InfraBench, 一个用于评估AI agents在真实基础设施管理任务中表现的基准套件, 覆盖系统栈和运维生命周期, 并引入细粒度风险评估. 实验表明现有agents在任务中表现有限, 常满足短期目标但留下非持久变更和安全隐患.
\arxivwithtarget{2608.11235}{CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference}{Yifan Wu, Yufeng Zhang, Kenli Li}\textbf{cs.AI}.
本文提出CORA-Diff, 一种无需训练的扩散语言模型推理加速方法, 通过置信度和持久性门控识别早期稳定的token位置, 减少冗余去噪计算. 实验表明其在多个任务上实现2.7x-3.3x加速, 但方法本质为工程优化, 缺乏理论或方法上的开创性, 且与关键词列表关联较弱.
\arxivwithtarget{2608.11237}{Geometry-aware Incremental Neural Operator for Long-Horizon PDE prediction}{Jiaquan Zhang, Shuxu Chen, Haifan Meng, Yi Lu, Zhihan Lyu, Fan Mo, Wei Dong, Yang Yang, Chaoning Zhang}\textbf{cs.AI}.
本文提出一种几何感知增量神经算子(GeoIncNO) , 通过预测潜在增量并利用低秩投影器调节活跃频带内的通道耦合, 以及均值-波动解耦重建机制, 提升长时程PDE预测的稳定性和谱保真度. 实验在多个1D至3D基准上验证了其有效性.
\arxivwithtarget{2608.11238}{Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability}{Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song}\textbf{cs.AI}.
本文提出Q-CARE框架, 通过将查询分解为子查询、答案分解为原子声明, 实现无需参考的RAG评估, 并引入查询覆盖与声明可验证性原则. 实验表明其与人类判断的相关性优于现有评估指标, 但方法主要为工程性整合, 缺乏理论或方法论上的开创性突破.
\arxivwithtarget{2608.11240}{VQ-bench: A Composable Vector Quantization Framework}{Ashwin Padaki, Amir Ingber, Edo Liberty}\textbf{cs.AI}, cs.DB.
本文提出了一个统一的向量量化(vector quantization) 框架VQ-bench, 将常见的量化算法分解为7种概念性原语并支持任意组合, 重新表达了25种常见量化器, 并开源了可复现的基准测试工具. 该工作主要面向AI基础设施中的工程实践, 与关键词列表中的核心理论概念关联较弱.
\arxivwithtarget{2608.11241}{RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle}{Dongyang Ao, Kaixiang Fang, Shijie Xu}\textbf{cs.AI}, cs.IR.
本文介绍了RecSys Factory, 一个部署于腾讯推荐业务线的LLM agent平台, 通过将agent自主性限制在决策点而非整个流水线, 以平衡自主性、确定性和效率的三难问题. 平台在78天内记录了1624次CLI工具调度, 成功率为78.6%, 但未提供与受控基线的对比, 仅作为案例观察报告.
\arxivwithtarget{2608.11243}{The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification}{Yoshinori Watanabe}\textbf{cs.AI}, cs.LG.
本文从singular learning theory (SLT)的视角论证了语义安全约束(如智能体不逃出沙箱) 在形式上是off-support对象, 即不关于数据分布与模型的\(\sigma\)-代数可测, 由此推导出奖励黑客、贝叶斯先验设计失效等现象, 并讨论了形式化验证的局部可证性. 文章以2026年某评估事件为案例, 但整体为概念性论证, 与关键词关联较弱.
\arxivwithtarget{2608.11244}{BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model}{Jia-Rui Lin, Junxi Guo, Keyin Chen, Peng Pan}\textbf{cs.AI}, cs.CL.
本文构建了面向建筑工程标准问答的多模态知识图谱框架BEST-KAG, 通过规则与大语言模型混合的知识抽取流程和基于图谱检索的增强生成架构, 提升了多子句推理与可追溯证据链接能力. 实验表明其在BLEU和ROUGE等指标上优于主流大语言模型.
\arxivwithtarget{2608.11245}{Towards Sustainable Learning in Online Education: A Reinforcement Learning Approach}{Chaofan Zhai, Yicheng Song, Ravi Bapna, Junyao Ye}\textbf{cs.AI}, cs.CY, cs.LG.
本文提出了一种基于强化学习的AI Tutor模型, 用于优化在线教育的短期和长期学习效果, 并在大规模真实数据上验证了其优于现有基线方法. 该工作主要关注教育场景中的学习路径优化, 与关键词列表中的核心主题关联较弱.
\arxivwithtarget{2608.11246}{Towards the Harness of Embodied Agents}{Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu}\textbf{cs.AI}, cs.LG, cs.RO.
本文提出Thea, 一种为具身智能体(embodied agents) 设计的harness框架, 将agentic loop与机器人能力封装为可调用工具, 并针对物理世界缺失软件环境中的状态读取与动作评估能力, 引入Scene Graph as Context(持久符号化世界表示) 与Evaluation as Exit Codes(动作终止、成功判定与失败诊断机制) , 从而闭环连接智能体与物理世界, 使长时程任务在真实环境中得以完成. 该方法与关键词中的agent高度契合, 为具身智能体系统设计提供了新的基础设施范式.
\arxivwithtarget{2608.11247}{Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier}{Zafar Hussain, Kristoffer Nielbo}\textbf{cs.AI}, cs.MA.
本文研究了多模型协作场景中, 错误多数意见对模型正确回答的颠覆效应, 并提出了Resistance与Receptivity两个维度来评估现有缓解策略. 实验发现多数方法在这两个维度上存在权衡, 仅推理方法在特定数据集上能同时提升两者.
\arxivwithtarget{2608.11248}{EvoGraph-Mem: Failure-Aware Editable Graph Memory for Long-Term Language Agents}{Yuxi Qian, Yuxiang Ren}\textbf{cs.AI}, cs.MA.
本文提出EvoGraph-Mem, 一种基于可编辑insight graph的failure-aware memory maintenance框架, 用于解决长期语言agent中记忆质量随时间退化导致的memory pollution问题. 该框架通过为每个insight节点追踪positive evidence、negative evidence和activation state来区分可复用与冲突或无效的记忆, 并引入utility-aware retrieval mechanism和graph controller, 在任务执行后对记忆图进行保留、归档、修订和新增操作. 实验表明该方法在多种backbone模型上优于现有memory-based agent基线, 并证明append-only memory在long-horizon任务中不足, 而evidence-aware retrieval和graph-level editing能提升记忆可靠性与下游性能. 该工作与关键词中的agent和context高度契合, 为长期agent记忆维护提供了开创性的图编辑机制.
\arxivwithtarget{2608.11250}{AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search}{Weicheng Ye, Youran Sun, Xingyu Ren, Shunyao Yu, Chugang Yi, Haizhao Yang}\textbf{cs.AI}, cs.MA, q-fin.CP, q-fin.PM.
AgonAlpha提出了一种自主alpha挖掘架构, 将搜索空间从单一公式扩展至冻结的研究工件(包括假设、可执行表达式、平台证据、理由和审查状态) , 并首次结合了带重新执行与否决权的对抗性审查器、pending-aware并行预算分配以及完整的证据追踪. 该系统在WorldQuant BRAIN上独立部署于五个用户和六个模型后端, 取得了Fitness 9.50和Sharpe 3.48的显著结果, 同时保留了每个提交的prompt-to-expression来源. 该方法在agentic search和自动化研究验证方面具有开创性, 与关键词中的agent和context高度契合.
\arxivwithtarget{2608.11252}{Local verification cannot detect non-transportability: a cohomological theory of context preservation in agentic reasoning}{Suyash Mishra}\textbf{cs.AI}, cs.ET, cs.GT, cs.MA.
本文提出了一种基于Cech上同调和Hodge分解的理论框架, 用于分析agentic AI系统中局部验证无法检测跨上下文结论非可转移性的问题, 并引入Ksetra程序进行估计与检验. 该工作与关键词中的agent和context有一定关联, 但方法偏理论且非开创性突破.
\arxivwithtarget{2608.11255}{Symbolic Machine Learning for Vapor-Liquid Equilibrium Prediction in Cx-N2 Binary Mixtures}{Bongseok Kim, Suman Chakraborty, Gary Huang, Mehek Mathur, Guang Lin, Li Qiao}\textbf{cs.AI}, cs.LG, physics.comp-ph.
本文提出一种符号机器学习方法, 为Peng-Robinson状态方程在烃-氮二元混合物气液平衡预测中引入可解释的符号修正, 通过两阶段策略提升预测精度, 但方法创新性有限且与关键词关联较弱.
\arxivwithtarget{2608.11258}{Adaptive Hybrid Particle Swarm Optimization with Gradient Descent}{Aryan Gurudeo}\textbf{cs.AI}, cs.NE.
本文提出了一种自适应混合粒子群优化算法(AHPSO) , 通过sigmoid函数根据群体多样性自动调节梯度影响, 在探索阶段减弱梯度、在开发阶段增强梯度, 无需手动切换阶段. 实验表明该方法在特定平滑局部盆地问题上优于标准PSO, 但整体优势有限, 未声称具有普遍优越性.
\arxivwithtarget{2608.11260}{Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning}{Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang}\textbf{cs.AI}, cs.CV.
本文提出了一种从训练-free到agentic推理的视频异常检测(VAD)新范式, 针对现有方法中“何时发生”与“发生了什么”的割裂问题, 受人类全局浏览-局部审视-迭代修正的认知过程启发, 构建了Glance then Scrutinize (GtS)训练-free框架, 并进一步提出工具增强的agentic VAD方法, 其中多模态大语言模型通过冷启动监督微调和强化学习学习调用视频裁剪工具、密集重采样帧检查及自我纠正定位假设. 该方法在扩展的VAGU-T基准(含7,567个真实视频和21类异常) 上显著超越训练-free基线, 并引入联合评估指标JeAUG同时衡量语义可解释性和时间精度, 为VAD领域提供了从静态推理到动态agentic推理的统一范式, 与关键词“agent”高度契合.
\arxivwithtarget{2608.11323}{Deployment Decision Reliability: A Generalizability-Theory Framework for Sizing Long-Horizon Agent Evaluations}{Vasundra Srinivasan}\textbf{cs.AI}, cs.LG.
本文提出Deployment Decision Reliability (DDR)框架, 运用四facet Generalizability Theory方差分解(结合Henderson Method-I、REML和Bayesian binomial GLMM三种估计器) 分析三个开放agent-trace基准, 发现agent主效应占总方差不足3%, 而agent-by-task交互占7-23%, 证明leaderboard排名反映的是任务特化而非通用能力. 该工作揭示了aggregate reliability在困难任务上崩溃($E\rho^2$从0.752降至0.000) 及训练-留出可靠性负相关($r=-0.90$) 等反直觉现象, 为长时程agent评估的可靠性度量提供了开创性方法论框架, 与关键词中agent和context高度契合.
\arxivwithtarget{2608.11341}{Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence}{Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang}\textbf{cs.AI}.
本文提出了Apodex Discovery框架, 用于构建和评估可进行长期、可验证调查的发现型AI系统, 包含问题侦察、环境抽象和独立评估组件, 并在AAV衣壳设计和药物重定位任务中展示了性能提升. 该工作主要聚焦于AI评估框架而非特定数学方法, 与关键词关联较弱.
\arxivwithtarget{2608.11343}{Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval}{Archan Dutta, Vyanktesh Kanungo}\textbf{cs.AI}, cs.CV, cs.IR, cs.LG.
本文比较了原生多模态embedding模型Gemini Embedding 2与前沿LLM(如GPT-4.1和Claude Sonnet 4.6) 在Flickr30k硬负样本文本到图像检索任务上的表现, 发现LLM在零样本排序上可与多模态embedding匹敌, 但后者在预计算后更适合低延迟应用.
\arxivwithtarget{2608.11354}{Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces}{Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri}\textbf{cs.AI}.
本文提出了一种基于逆向心智理论(Inverse Theory of Mind) 的推荐系统框架, 通过从用户交互行为反推其信念与偏好, 并利用LLM进行反事实推理以构建用户画像. 实验表明该方法在多项预测任务上表现良好, 但整体属于应用型改进, 与关键词列表中的核心概念关联较弱.
\arxivwithtarget{2608.11381}{From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate}{Pardis Taghavi, Santosh Bhavani}\textbf{cs.AI}, cs.LG.
本文研究了金融分析中LLM专业化分工的效果, 通过Larix框架将欧洲上市房地产分析分解为八个专家子任务, 并对比了整体提示与分解提示的性能差异, 同时使用GRPO对Qwen3.5-9B进行后训练以提升判断任务表现. 结果表明分解提示改善数值任务但可能损害判断任务, 而参数微调则能全面提升性能.
\arxivwithtarget{2608.11403}{When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs}{Utkarsh Bahuguna}\textbf{cs.AI}, cs.CL, cs.LG.
本文研究了小规模指令微调模型在GPQA Diamond基准上使用self-consistency多数投票策略的效果, 发现该策略在多数问题上反而降低了准确率, 且置信度与正确性不相关. 作者通过预注册实验验证了此现象, 并指出无验证器的门控方法无法达到理论上的oracle上限.
\arxivwithtarget{2608.11420}{Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology}{Del Coburn, Scott Sanner, Dan Silver}\textbf{cs.AI}, cs.CL.
本文提出了一种名为Social Chain of Thought (SCoT)的多智能体架构, 用于医学鉴别诊断, 通过多轮专家对话模拟协作推理过程. 实验表明其在复杂病例上的召回率优于单智能体基线, 但方法本质上是多智能体协作框架, 与关键词中的code、spectral、Muon、pretrain、attention等核心概念关联较弱.
\arxivwithtarget{2608.11434}{Benchmarking LLM Judges for Mobile Agent Evaluation}{Ziqiang Wan, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang}\textbf{cs.AI}, cs.CL, cs.CV.
本文构建了MobileJudgeBench基准, 系统评估了LLM作为裁判在移动智能体轨迹上的可靠性, 发现简单基线方法即可匹敌复杂方法, 且基准质量指标能预测实际效用. 该工作聚焦于智能体评估方法, 与关键词中agent相关但创新性有限.
\arxivwithtarget{2608.11483}{A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization}{Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha}\textbf{cs.AI}, cs.LG, q-bio.QM.
本文提出了SABLE框架, 一个基于LLM的自然语言编排的模块化智能体系统, 用于药物发现中的hit-to-lead多目标优化, 通过反应模板枚举和贝叶斯优化在合成约束下筛选候选分子. 该工作主要面向计算药物设计应用, 与关键词中的agent有一定关联但方法创新性一般.
\arxivwithtarget{2608.11493}{From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation}{Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong}\textbf{cs.AI}, cs.LG.
本文研究了LLM在推荐系统评估中的双向合理化问题, 提出通过微调和偏好优化的行为对齐框架来提升预测可靠性, 并在真实数据上验证了效果. 该方法与关键词列表中的概念关联较弱.
\arxivwithtarget{2608.11583}{Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models}{Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari}\textbf{cs.AI}.
本文通过将对齐模型的权重移植到未对齐基础模型, 研究了大型语言模型中安全对齐拒绝行为的编码位置, 发现MLP层和中网络区块对拒绝行为起主导作用, 且相关参数呈中部集中分布. 研究还揭示了安全相关组件的非加性组合效应, 表明安全对齐具有局部性和交互敏感性.
\arxivwithtarget{2608.11584}{EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval}{Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng}\textbf{cs.AI}.
本文提出了一个面向企业级RAG场景的基准测试EnterpriseRAG, 模拟检索噪声、知识缺口和事实冲突等非理想条件, 评估了13个LLM的指令遵循能力, 发现高单约束满足率与低整体合规率之间存在显著差距. 该工作主要关注LLM在复杂检索环境下的鲁棒性评估, 与关键词列表中的核心主题关联较弱.
\arxivwithtarget{2608.11588}{CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications}{Linqiang Guo, Li Gu, Zihuan Jiang, Zhixiang Chi, Siobhan Reid, Ziqiang Wang, Yuanhao Yu, Wei Liu, Yang Wang, Tse-Hsun, Chen}\textbf{cs.AI}.
本文提出CoAdapt-GUI框架, 通过测试时适应(TTA) 联合调整工作流上下文和策略, 以提升移动GUI智能体在未见应用上的泛化能力. 实验表明该方法在AndroidWorld基准上优于仅策略适应的基线, 但方法属于工程性改进, 缺乏理论或方法论上的开创性.
\arxivwithtarget{2608.11604}{Learning from Online User Feedback for Shopping Agents}{Haobo Zhang, Kelong Mao, Sulong Xu, Simiu Gu, Zhicheng Dou}\textbf{cs.AI}.
本文提出LOFA框架, 利用真实在线用户交互日志训练购物agent, 结合强化学习与反馈感知蒸馏来提升推荐质量, 但方法创新性一般且与关键词契合度较低.
\arxivwithtarget{2608.11605}{Foresight Without Seeing: Latent Futures for World Action Models}{Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang}\textbf{cs.AI}.
本文提出ForeWAM, 一种无需解码未来视频即可为动作生成提供预测上下文的World Action Model, 通过Future-KV机制复用视觉潜变量的key-value状态, 并引入动力学寄存器提升效率, 在LIBERO基准上取得较好性能.
\arxivwithtarget{2608.11616}{MBA: Multimodal Benchmark and Agents for Real-World Business Ideation}{Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim}\textbf{cs.AI}, cs.CV, cs.LG.
本文提出了MBA-Bench, 首个用于训练和评估商业创意生成agent的多模态基准, 包含30K样本和六类视觉线索, 并设计了MBA-b与MBA-k两种agent, 通过LoRA微调和策略优化提升创意性与可行性. 该工作聚焦于多模态商业应用, 与关键词中的agent相关, 但方法创新性有限.
\arxivwithtarget{2608.11625}{Making AI-Generated Feedback Matter: From Provision to Student Enactment}{Omar Alsaiari, Nilufar Baghaei, Jason M. Lodge, Dragan Gaševi'c, Naomi Winstone, Hassan Khosravi}\textbf{cs.AI}.
本文通过大规模准实验比较了三种AI反馈工作流对学生反馈采纳的影响, 发现结构化反馈流程能显著提升学习效果, 强调工作流设计而非单纯AI访问的重要性.
\arxivwithtarget{2608.11631}{CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement}{Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou}\textbf{cs.AI}.
本文提出CLAIM框架, 利用多模型答案分歧的熵来量化查询不确定性, 并据此生成合成数据训练澄清决策模型, 无需人工标注. 实验表明该方法能学习稳定的澄清策略, 但方法本身创新性一般, 与关键词列表关联较弱.
\arxivwithtarget{2608.11676}{XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication}{Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee}\textbf{cs.AI}.
本文提出XBRIDGE, 一种面向异构大语言模型(LLM) 多智能体系统的无解码通信协议, 解决了跨架构潜在空间通信中的实体锚定问题(entity grounding problem) . 通过Lexical Anchor Mapping (LAM)将发送者的上下文token映射到接收者的词表, 提供离散实体锚点, 并结合Latent Enrichment Bridge (LEB)使接收者查询发送者的隐藏状态以获取上下文增强, 从而避免连续瓶颈中的稀有token压缩崩溃(bridge-only F1约30%) . 实验表明, 在Llama、Qwen和Mistral三种模型家族、七个基准及双向通信中, XBRIDGE在所有任务上优于基于文本的通信, 延迟降低11倍, 且在同架构设置下在六项任务上超过KV-sharing基线, 仅需264M可训练参数(占接收者的3.8%) , 为异构agent通信提供了高效且可扩展的潜在级交互方案.
\arxivwithtarget{2608.11679}{AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection}{Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin}\textbf{cs.AI}, cs.IR, cs.MA.
本文提出AgenticTwin框架, 将大语言模型(LLM) 推理与数字孪生异常检测管道集成, 用于解释系统异常并支持操作员自然语言查询. 实验表明, 结构化智能体协作和知识推理可提升诊断质量, 但方法主要为工程集成, 缺乏开创性理论贡献.
\arxivwithtarget{2608.11683}{FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents}{Yuhao Zhang, O. Ozan Koyluoglu, Thejas Venkatesh, Richard Diehl Martinez, Vishank Bhatia, Arash Alidoust, Ashwin Paranjape}\textbf{cs.AI}, cs.CL.
本文提出了一个面向金融投资分析场景的AI agent评测基准FrontierFinance, 包含220个专家级查询和11,543个评分细则, 覆盖投资者工作流的六个关键用例. 评测发现工具框架对系统性能影响显著, 且开源模型在成本效益上接近专有模型, 但整体性能仍有限.
\arxivwithtarget{2608.11692}{HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting}{Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu}\textbf{cs.AI}.
本文提出HUGIN训练框架, 通过数据增强和全局上下文排序提升视觉语言模型在自主物流分拣中的多场景联合规划能力, 并构建SortingBench基准验证效果.
\arxivwithtarget{2608.11705}{Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning}{Lang Cao}\textbf{cs.AI}.
本文研究了大型语言模型在不同系统提示词特质下的安全行为不一致问题, 提出了基于自蒸馏的TIST框架和TraSN方法以稳定安全决策, 实验表明该方法在保持通用能力的同时提升了安全鲁棒性.
\arxivwithtarget{2608.11724}{Proportional Analogies on Probability Distributions via Bayesian Updating}{Pierre-Alexandre Murena}\textbf{cs.AI}.
本文基于Bayesian updating提出了一种概率分布间的比例类比形式化框架, 并探讨了其在指数族及Gaussian mixture近似下的扩展. 该工作为类比推理在概率域的应用提供了新视角, 但未直接涉及所给关键词.
\arxivwithtarget{2608.11727}{Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents}{Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang}\textbf{cs.AI}.
本文提出了Harness-IF基准, 用于评估编码agent在多种指令表面上的指令遵循能力, 并引入Against-Prior Accuracy指标以区分真实遵循与偶然行为. 实验表明, 前沿模型在对抗先验规则上表现普遍较差, 且聚合分数会高估遵循程度.
\arxivwithtarget{2608.11768}{HyperANFIS: Enhancing Rule Representation and Interpretability in Adaptive Neuro-Fuzzy Systems via Hyperbolic Geometry}{Haoran Pei, Zhao Su, Zetao Lin, Haoran Li, Jun Shen, Qi Zhu, Lan Guo, Qingguo Zhou, Binbin Yong}\textbf{cs.AI}.
本文提出HyperANFIS, 将自适应神经模糊推理系统(ANFIS) 的规则原型学习、规则激活和结论聚合从Euclidean空间推广到hyperbolic space, 同时保留IF-THEN模糊规则的语义与可解释性. 通过利用hyperbolic geometry的表示能力, 该方法增强了模糊推理过程, 提升了预测精度、规则间协作及规则可信度, 并在多个数据集上优于标准ANFIS及其变体. 该工作为模糊系统与几何表示学习的结合提供了新思路, 与关键词中的“attention”在规则激活机制上存在潜在关联.
\arxivwithtarget{2608.11775}{The Sleeping Agent: What Gist-Based Context Compression Loses and Why}{Nicholas E. Kyrkewood}\textbf{cs.AI}, cs.CL.
本文提出Salience-Weighted Consolidation (SWC)框架, 一种受睡眠记忆巩固启发的基于gist的上下文压缩方法, 用于诊断长时程语言模型agent中压缩对记忆检索的影响. 通过将对话历史按salience分层并对中优先级内容进行结构化gist抽象, 作者在LoCoMo数据集上发现压缩显著提升多跳推理和单跳事实问题, 但严重损害时间类问题, 并定位到gist抽象提示词丢弃日期时间的机制. 通过单句提示词修改, 时间表达保留率从3.05%提升至62.39%, 时间问题准确率恢复+0.314, 展示了该修复的精准性, 为agent上下文压缩设计提供了重要见解.
\arxivwithtarget{2608.11888}{Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents}{Gen Dong, Yanjie Gao, Liqun Li, Tianyin Xu, Yu Hua, Fan Yang}\textbf{cs.AI}.
本文通过差分分析框架对LLM agents中的skill-induced failures进行了实证研究, 发现看似相关的skills常导致功能错误或效率回归, 并提出了SkillTriage工具用于归因分析. 该工作主要聚焦于agent skills的负面影响, 与关键词中的agent有一定关联, 但方法较为常规, 未涉及spectral、Muon等核心概念.