đŠđČđźđżđ°đ”-đ„đ â the first đżđČđœđżđŒđ±đđ°đđ¶đŒđ» đŒđł đđČđČđœđđČđČđž-đ„đ (đđČđżđŒ) with reinforcement learning
What do you think of something like this?
For training reasoning and search-augmented LLM agents with reinforcement learning.
This is a step towards training an đŒđœđČđ»-đđŒđđżđ°đČ đąđœđČđ»đđ âđđČđČđœ đżđČđđČđźđżđ°đ”â via RL.
đŻđ đŻđźđđČ đđđ đâincluding not just đ€đđČđ» đź.đ± but also đđčđźđșđź đŻ.đźâlearn to đżđČđźđđŒđ» and đ°đźđčđč đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČđ all on their own.
We follow Deepseek R1-zero, starting with a base LLM, prompts, and ground-truth rewards. Then, we apply đżđČđ¶đ»đłđŒđżđ°đČđșđČđ»đ đčđČđźđżđ»đ¶đ»đŽ (RL). Our experiments are conducted on đĄđźđđđżđźđč đ€đđČđđđ¶đŒđ»đ (đĄđ€), a factual QA dataset in which LLMs struggle with direct answers, making search engine calls crucial. The only supervision? A đżđđčđČ-đŻđźđđČđ± đŒđđđ°đŒđșđČ đżđČđđźđżđ± (string exact match) to determine correctness.
We first experiment with đ„đ đđđ»đ¶đ»đŽ đ€đđĄâđđąđĄ search engine access, letting the đđđ (đđčđźđșđź đŻ.đź-đŻđ-đŻđźđđČ) answer questions on its own. Initially, the model produces đ±đđșđșđ đŒđđđœđđđ, but through RL, it đŽđżđźđ±đđźđčđčđ đčđČđźđżđ»đ to generate meaningful answers.

Next, we đ¶đ»đđđżđđ°đ the đđđ (đđčđźđșđź đŻ.đź-đŻđ-đŻđźđđČ) that it can đ°đźđčđč đź đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ to retrieve relevant information. đŠđđżđœđżđ¶đđ¶đ»đŽđčđ, even đđ¶đđ”đŒđđ any supervised fine-tuning (SFT), the đŻđźđđČ đđđ đčđČđźđżđ»đ đđŒ đ°đźđčđč đđ”đČ đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ, đ¶đ»đđČđżđœđżđČđ đđČđźđżđ°đ” đżđČđđđčđđ, đźđ»đ± đźđ»đđđČđż đŸđđČđđđ¶đŒđ»đâđźđčđč đđ”đżđŒđđŽđ” đ„đ!

We compare the performance of the đđđ đđ¶đđ”đŒđđ đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ đźđ°đ°đČđđ vs. đđđ đđ¶đđ” đđČđźđżđ°đ”-đźđđŽđșđČđ»đđČđ± đčđČđźđżđ»đ¶đ»đŽ via RL. The đđČđźđżđ°đ”-đČđ»đźđŻđčđČđ± đșđŒđ±đČđč đđ¶đ»đ!

When training đđčđźđșđź đŻ.đź-đŻđ-đŻđźđđČ with đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ đ°đźđčđčđ¶đ»đŽ, the response length follows an interesting trend:
đđ¶đżđđ, đ¶đ đ±đČđ°đżđČđźđđČđâthe model learns to đźđđŒđ¶đ± đČđ đ°đČđđđ¶đđČ đ±đđșđșđ đđŒđżđ±đ. đ§đ”đČđ», đ¶đ đ¶đ»đ°đżđČđźđđČđâas it learns to đ°đźđčđč đđ”đČ đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ đźđ»đ± đżđČđźđđŒđ» effectively. Since đĄđ€ đ¶đ đź đżđČđčđźđđ¶đđČđčđ đđ¶đșđœđčđČ đđźđđž, the response length đđđźđŻđ¶đčđ¶đđČđ đźđ ~đ±đŹđŹ đđŒđžđČđ»đ.

We experiment with đ€đđČđ»đź.đ±-đŻđ-đŻđźđđČ and đ€đđČđ»đź.đ±-đłđ-đŻđźđđČ under both with/without search engine RL settings. đđ đđŒđżđžđ đłđŒđż đŻđŒđđ”! Interestingly, in the đđČđźđżđ°đ”-đźđđŽđșđČđ»đđČđ± đđČđđđ¶đ»đŽ, the đŻđ đșđŒđ±đČđč đźđ°đ”đ¶đČđđČđ đœđČđżđłđŒđżđșđźđ»đ°đČ đ°đŒđșđœđźđżđźđŻđčđČ đđŒ đđ”đČ đłđ đșđŒđ±đČđč. đđđœđŒđđ”đČđđ¶đ: When an đđđ đ¶đ đ°đŒđ»đ»đČđ°đđČđ± đđŒ đČđ đđČđżđ»đźđč đ¶đ»đłđŒđżđșđźđđ¶đŒđ», its đżđČđźđđŒđ»đ¶đ»đŽ đźđŻđ¶đčđ¶đđ đșđźđ đ»đŒđ đ»đČđ°đČđđđźđżđ¶đčđ đżđČđŸđđ¶đżđČ đź đčđźđżđŽđČ đșđŒđ±đČđč đđ¶đđČ.

đđŒđđ” đŻđźđđČ đźđ»đ± đ¶đ»đđđżđđ°đđ¶đŒđ» đșđŒđ±đČđčđ đđŒđżđž! The đ¶đ»đđđżđđ°đđ¶đŒđ» đșđŒđ±đČđč converges đłđźđđđČđż and starts from đź đŻđČđđđČđż đ¶đ»đ¶đđ¶đźđč đœđČđżđłđŒđżđșđźđ»đ°đČ. However, the đłđ¶đ»đźđč đœđČđżđłđŒđżđșđźđ»đ°đČ of both models is đđČđżđ đđ¶đșđ¶đčđźđż. This suggests that while đ¶đ»đđđżđđ°đđ¶đŒđ» đđđ»đ¶đ»đŽ đźđ°đ°đČđčđČđżđźđđČđ đčđČđźđżđ»đ¶đ»đŽ, đżđČđ¶đ»đłđŒđżđ°đČđșđČđ»đ đčđČđźđżđ»đ¶đ»đŽ đ°đźđ» đŻđżđ¶đ±đŽđČ đđ”đČ đŽđźđœ đŒđđČđż đđ¶đșđČ.

We experiment with đ€đđČđ»đź.đ±-đŻđ-đŻđźđđČ, đđčđźđșđźđŻ.đź-đŻđ-đŻđźđđČ, đźđ»đ± đ€đđČđ»đź.đ±-đłđ-đŻđźđđČâand đđ”đČđ đźđčđč đđŒđżđž! This is đ»đŒđđźđŻđčđ đ±đ¶đłđłđČđżđČđ»đ đłđżđŒđș đșđźđđ” đżđČđźđđŒđ»đ¶đ»đŽ, where only the đ€đđČđ»đź.đ± đđČđżđ¶đČđ models succeed.

The đđđ đčđČđźđżđ»đ đđŒ đœđČđżđłđŒđżđș đșđđčđđ¶-đđđżđ» đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ đ°đźđčđčđ, refining its queries step by step to gather more relevant information. This showcases its ability to đ¶đđČđżđźđđ¶đđČđčđ đ¶đșđœđżđŒđđČ đżđČđđżđ¶đČđđźđč đźđ»đ± đżđČđźđđŒđ»đ¶đ»đŽâa key capability for real-world research agents!

Our framework supports đłđčđČđ đ¶đŻđčđČ đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČ đ°đ”đŒđ¶đ°đČđ, including: đđŒđ°đźđč đżđČđđżđ¶đČđđČđżđ (sparse/dense) đąđ»đčđ¶đ»đČ đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČđ (Google, Bing, etc.) đđđđđŒđș đđČđźđżđ°đ” đČđ»đŽđ¶đ»đČđâLaunch your own on any corpus and integrate it with RL effortlessly!
The pipeline is based on verl (https://github.com/volcengine/verl), a highly efficient RL framework.
Fully open source
Log in to comment and vote
No comments yet
Be the first to share your thoughts.