|
|
[Self-Evolving][02] DarwinX:Harness自进化(遗传算法) 偷星九月333 · 3 天前 |
|
|
[Agentic RL][29] MaxRL:从三个视角用最大似然重新理解强化学习 偷星九月333 · 1 周前 |
|
|
[Self-Evolving][01] 自进化/提升 Agent(上下文/记忆进化,参数进化,结构进化) 偷星九月333 · 2 周前 |
|
|
[知识蒸馏][17] ExOPD:On-policy Distillation中学生模型如何超过教师模型 偷星九月333 · 3 周前 |
|
|
KIMI K3的三个核心架构:KDA、Attention Residuals和Stable LatentMoE 偷星九月333 · 1 月前 |
|
|
[Agentic RL][28] ECHO:改善Agentic RL长程任务上下文过长、奖励分配问题 偷星九月333 · 1 月前 |
|
|
GLM5.2 IndexShare/KVShare讲解,更长的上下文,更低的成本,更快的速度 偷星九月333 · 1 月前 |