Pith. sign in

Paper Citation Record · LEDGER

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

As of 10 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 2 inbound Pith citation observations for arXiv:2501.18858.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.18858 v2

Coverage vector

measured 75 of 75 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T22:20:13.916248Z

measured 77 of 77 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-21T14:03:48.795572Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-21T14:04:11.992913Z

Reference resolution

75 of 75 outbound references displayed

  • verified exact1
  • verified fuzzy20
  • unresolved54
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 71fe9c34-df1e-4b17-9400-6858973e54b0 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.633401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.633401Z digest=sha256:5779622fe8e8603e49d4f417fd6e2c2bb721c37103c069593d7e0d81906697b0

Observation f088fb5a-aa32-4ba1-b6f6-40ddfa2d5c88 · outbound

This paper cites write newline.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.638251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.638251Z digest=sha256:f57356eba6990badbbf94ee541297953a2ff72bfe019c2119035861fe1da2de7

Observation e195ca26-6f57-4561-a9e6-10b2291ecac7 · outbound

This paper cites , Kakade, S.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Kakade, S

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.717422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.642400Z digest=sha256:0eb06060fdc1dea8a1a3a58eabfd926ca31eff71487d45643b55b110c2ece19d

Observation cc7719bf-d893-4b2c-9b03-bb40bf57eeff · outbound

This paper cites Introducing claude.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Introducing claude

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.706690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.646165Z digest=sha256:3dc83ec32fb561d3270f443ead3594babc0fa9f8a5785ae120c4f5ec9cdff55c

Observation 076e2db7-4171-4cf5-828f-5616832b49de · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.696409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.649958Z digest=sha256:144d7e33555693ee524c271f95ebf593afa3542b1114836835c29a56f8d3bf91

Observation c2fe5741-70da-4570-9461-16546785e7d0 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.686335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.653870Z digest=sha256:abcbc97a3a3a9b3df2f55ffe73d0ba6e8535b714ae3111c662707e9faaab3c7f

Observation 5be4c4d4-88dd-4f67-810a-34f71bdeafaf · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.676919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.657733Z digest=sha256:2ec6eb4b05470c92e81b6f9e21ac5cf9e3ba602f3aeeadf1d7cc4b698c14eaa6

Observation 170f180c-bcc1-4a58-a02a-a38eebec5602 · outbound

This paper cites , Yang, Z.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Yang, Z

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.666702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.661470Z digest=sha256:7e1fc6765b3113d368166a3b5bb4d54639f85baaabdc46f960c14f4f1261d8b6

Observation f9fc7748-358f-4432-9874-7940b231297f · outbound

This paper cites Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.665416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.665416Z digest=sha256:b05c6dff0b0ebfd45e7a7e4b5ace9c78303eb036f1e9252a4f53fa0921076cb3

Observation 28fc5344-66f0-4006-81e0-516a0875b960 · outbound

This paper cites Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.669361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.669361Z digest=sha256:76bb7b2ac8b64e4b8d055f89fd74d09b78bda647ad84e51a61ebc88711986338

Observation b907da4b-ebc8-4c88-ba8f-7e61c58abe4c · outbound

This paper cites , Zhong, H.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Zhong, H

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.656454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.673021Z digest=sha256:41c96188062007a9a86e570b2560b504081e887f67efea2217f9122160f7aaf9

Observation 151f09de-fc19-4add-b169-4ab3a373d826 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.645632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.677216Z digest=sha256:3b33a6b4450b3cafbe1e0086de3c28ad684c77e7218ef4d97a9c3e2f78d753e7

Observation 99a9f4d3-1a24-4259-bb1a-f77dd1726b1d · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Training Verifiers to Solve Math Word Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.680732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.680732Z digest=sha256:23374995694e7ab414baebaa4bee35381116d9af4b8626403facd3437688ba06

Observation cee18fd6-77cc-417c-9f2d-271f43a01737 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.635329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.684721Z digest=sha256:b5b79717b945a8c33819adcce6d8e7045638e49f3c8782a3c9ed57e8706804d0

Observation 9c860370-c1f9-429c-8617-95cc1eab5d8a · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.687997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.687997Z digest=sha256:8ee296b76fcd4e5c3be1bf9de5871d1fedf29eefb32c6fd95ce6057212168980

Observation 6eac74c1-acf7-456a-abaf-aaef16daf23b · outbound

This paper cites SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.691866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.691866Z digest=sha256:d0c3538d1a9730fbdacd07f24a96d9a199e34cf00f7f96efca06d0534e878b3b

Observation b9e83fa6-3446-46d5-9f24-12ff698aa7ba · outbound

This paper cites Reinforced Self-Training (ReST) for Language Modeling.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Reinforced Self-Training (ReST) for Language Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.695913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.695913Z digest=sha256:46dbf9dec44e87f5a36c67ed8144b429f86d562b1b731849d8fb725a87afd410

Observation 1a1b9781-fcba-44e3-9fae-0bc47470c146 · outbound

This paper cites Efficient (Soft) Q-Learning for Text Generation with Limited Good Data.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Efficient (Soft) Q-Learning for Text Generation with Limited Good Data

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-09T22:20:14.320291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.699639Z digest=sha256:fd748eb73368abf6141ed8ac574ccd7bb1cfe07244665a76589ea56fcbbddbfb

Observation ce2ba8c8-db78-404f-8dd7-5ee390bc2fc5 · outbound

This paper cites , Luo, R.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Luo, R

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.625702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.703511Z digest=sha256:fa9885ef3944a388dffc03e62ca4aeb7afd6959ff3c8756190ffb21915b2cd9c

Observation e8e0d51b-a1a0-47f0-aea8-e03856666c41 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.707110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.707110Z digest=sha256:b7f1a3eea19dcb9276113de65c6dc9128c9f60f233624e2e2e7023fbb885809c

Observation 6a29718f-ea22-443e-b189-5f8fbc076a78 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.615720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.710609Z digest=sha256:5738dee9947be2b78f1e84e55fc90afafc93e51005e02e61f16dcf5a3f23c5d0

Observation eaa27419-dfab-48d9-b8e1-6d3854144ef1 · outbound

This paper cites Amortizing intractable inference in large language models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Amortizing intractable inference in large language models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.714127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.714127Z digest=sha256:fdfdad0be694ed61eb356dedfea09cc95ac672c6e9e0385e5f9fc0c3080300f9

Observation ff84e239-6f43-4fc3-b2a0-022f6d2f7eba · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning LoRA: Low-Rank Adaptation of Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.717907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.717907Z digest=sha256:bb4fd0de9af2e4c45270377ab9c13b3416df8079c7ba0602e0ac453f60e48ab6

Observation 4eb03066-89ec-4e72-aa4b-7c294afddd0e · outbound

This paper cites OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.721525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.721525Z digest=sha256:59fde1864b1ebd24fdb20141a89cb8c87c06fcb82dc7b431d393b45b4e5977f4

Observation 44582844-d450-4503-8a37-055ec5a81c52 · outbound

This paper cites Mistral 7B.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Mistral 7B

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.725354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.725354Z digest=sha256:08d76423f4c5c1d94a0e56d8f122690270e8be72768c1cb731028dc2601315ef

Observation 4a724be0-ae5f-4b59-910e-f24b32fe265d · outbound

This paper cites Auto-Encoding Variational Bayes.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Auto-Encoding Variational Bayes

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.729025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.729025Z digest=sha256:5670b599e49c7908c30b26b6e8ee5fff40e53ebab8180a1bcd6fe3b830c1a411

Observation 36a3b135-0549-4268-8b52-487fbe993c53 · outbound

This paper cites , Andreassen, A.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Andreassen, A

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.605799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.732483Z digest=sha256:c3afe7ca0cd586d57fbdf5a41fb61c5818199d26cbce3e3b7da4f2115ffdd1ac

Observation 929b64d2-b666-48b7-907c-3b72e02f23cc · outbound

This paper cites Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.735791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.735791Z digest=sha256:19fdc3cafcd7d0d42d0a2c8c10aa9fbebe0c18f7e41ebbdbbced2475dfc796df

Observation b8548978-17ef-4388-974f-449abcdc1b19 · outbound

This paper cites , Xia, C.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Xia, C

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.596306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.739386Z digest=sha256:c9fbfafb4e2966e011f6a5283a701fc40b3a7f0ee9b5b8eda56be818a9f0149e

Observation 9bef8d91-24eb-4dc5-ba50-9ed4ec2f475a · outbound

This paper cites Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.742905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.742905Z digest=sha256:35a801dbae71b8c3e339098dd5ac4d2251f40b2db41c049ca77af56c4ce1f59e

Observation d572741f-2b18-400f-a600-756f41ebd414 · outbound

This paper cites , Welleck, S.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Welleck, S

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.586300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.746900Z digest=sha256:bfd9fb78452b7c878ba90afff60788f694cbde4c80bdc94cb954e6aa602818df

Observation 13d63a5c-4fc6-4abb-bc32-cac1fb86f9fc · outbound

This paper cites American mathematics competitions amc 12, 2023.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning American mathematics competitions amc 12, 2023

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.576757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.750668Z digest=sha256:bea3a5c5ccd835502707ac3dd747a74e3f873fef1b247db599ae922a76233ab9

Observation ce58649c-b0fe-470a-9320-6ea26684665d · outbound

This paper cites American invitational mathematics examination aime i & ii, 2024.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning American invitational mathematics examination aime i & ii, 2024

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.566487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.754406Z digest=sha256:848acd6b4938ecf9c971fb8d3ee580924eab4159b4c7235c083aa802021e7d91

Observation 458f3f4d-8e64-4e03-a712-f8cf3b0258cb · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.758075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.758075Z digest=sha256:4902fb1b32dd617784b4edcffe0a8ef14a4745223a947884b49547f1da61ba07

Observation 42f46a88-af47-4f23-bb01-2739bb19f89f · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.555846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.762198Z digest=sha256:410faf15838fc2cac12a935864adad7dc7481edc6434135c1743527f399f479e

Observation 9658b0a5-77e1-41f9-a48d-c7eb74e19c51 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.545400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.765945Z digest=sha256:ac015ae5ab44d3a6809fc7471faa4c34346987f07c73863c462234c9db8f0964

Observation a10dae46-7f57-4acc-8641-b3ce9b95d4b5 · outbound

This paper cites GPT-4 Technical Report.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning GPT-4 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.769921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.769921Z digest=sha256:f64a3fa8566c06b5d69cae45de6dafee6a5e727b6969ca20aae4505a5cf5b1c7

Observation 3c16a765-d8b0-4f94-8105-b30e3de67077 · outbound

This paper cites Introducing openai o1.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Introducing openai o1

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.534173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.773819Z digest=sha256:106728eb278bbe98e316f5c4be88596f31ca5443ebc36de1d3358f90c76aebe6

Observation d211d0d1-ca8b-41ef-a3d7-0f54e36df2c1 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.524244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.777649Z digest=sha256:2e73269a2c025333adda262eb4587c9a5f8650be38d720366c1415a6abd519ed

Observation d4263822-9942-4e16-8e67-8b2d01b6219e · outbound

This paper cites Dueling RL: Reinforcement Learning with Trajectory Preferences.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Dueling RL: Reinforcement Learning with Trajectory Preferences

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.781528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.781528Z digest=sha256:a271d707eb6a72c45a742bf72b0461e2ac9b16df05f2c873462c1cc34dd27257

Observation a61768a3-3504-445c-926e-4a5e1debd6ff · outbound

This paper cites Iterative Reasoning Preference Optimization.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Iterative Reasoning Preference Optimization

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.785735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.785735Z digest=sha256:564ecfe793bc74d6ced51441a6a15a2df00e5153bc30f2eb886344c046b3d274

Observation 431f54c2-b983-4d6d-8d7d-9f937680a2a5 · outbound

This paper cites , Sharma, A.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Sharma, A

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.514047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.789876Z digest=sha256:c97ed57ca162ac979682f468ad5c7df83abd27d12cc52a05298a5268ca4edc1b

Observation 3744cd2a-5353-45e9-8a3d-3be015f6689a · outbound

This paper cites , Hou, B.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Hou, B

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.503355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.793488Z digest=sha256:1e8e8e3301c90f183b5c47ac3fe178516f7945e55bff0e1ed2f48962b874ba46

Observation c97db65f-60d2-4741-8838-efd8c12fa671 · outbound

This paper cites and Ritter, D.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning and Ritter, D

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.492894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.797176Z digest=sha256:0fe44234eef6444e55ed4ea7540b69fb2b338bdb4f86f50993bdbc3014721d20

Observation 8257da74-90e2-406d-bb78-062204fe394b · outbound

This paper cites Proximal Policy Optimization Algorithms.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Proximal Policy Optimization Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.800921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.800921Z digest=sha256:b5558cd0f60b2fdfb4eb67247834e453d749a9fac68dfde8ed2538192b5e51e2

Observation 9e171bc6-a046-41e4-8d1b-7dd9151dacf6 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.804411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.804411Z digest=sha256:7e6d0296257e1ccbfe68ec5fa8b880b11cbc8b7c48e852bc8a35beb91b3ddff0

Observation 25cc60a7-c4c1-42d8-b73c-5dae2eff1877 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.808058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.808058Z digest=sha256:9600d26cc7e4bff01d7a5d9e1e6d98df99a064ff8cd45aeb83fe5d08df0e08c1

Observation faeffd8c-00fd-4ec4-83ba-5d5f2b921b3e · outbound

This paper cites Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.811949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.811949Z digest=sha256:72c2d7e02f28b802d361aa29933121509dd3d6bd9d1dcc1cd9b9220cb6e8d442

Observation 4c74fd54-2b9a-4647-92cc-30d5b6ce3259 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.815878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.815878Z digest=sha256:a5c18ceaea24b49b3c69c9b11d684e7dae131507025d2d8b93a166b0637aa4d4

Observation 57ef5985-b31d-4716-bd89-10a02249b3a5 · outbound

This paper cites Generalized Preference Optimization: A Unified Approach to Offline Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Generalized Preference Optimization: A Unified Approach to Offline Alignment

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.819384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.819384Z digest=sha256:fdcf529770543f8fd39b31c229c4f7af188dc92d09041b9b0f207a62f23c499c

Observation 371b0358-3e5e-47bf-b084-665a4e7d832a · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Gemma: Open Models Based on Gemini Research and Technology

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.822920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.822920Z digest=sha256:5fa9bed3ba04cf2c49ca574b18108c6100dd1c37898c61cb8da4512bf3aaf0de

Observation 778fdd76-1f49-48ed-a34c-9bd0cda5bd47 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Gemma 2: Improving Open Language Models at a Practical Size

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.826434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.826434Z digest=sha256:6897f3382b8e03ffa63c1f755ce62f60e3624c58d93439f8112de3ea3117ec8d

Observation 58af0572-2bab-4f77-bac4-e589513b151e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.481196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.830168Z digest=sha256:7a7be354205b25a1e42b63ef06f0506c84dece03b6664feb8002d87a973c8a8f

Observation e6f7e4bb-c600-4fb4-ac47-f7579670accf · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning LLaMA: Open and Efficient Foundation Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.833736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.833736Z digest=sha256:849cba3948eb36090ad3e901c88f4fbf3343128317efa77576b277275e18477d

Observation 5f1be69d-e707-456a-8242-d80ec7109be4 · outbound

This paper cites Offline Reinforcement Learning for LLM Multi-Step Reasoning.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Offline Reinforcement Learning for LLM Multi-Step Reasoning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.837391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.837391Z digest=sha256:a7492fa604188251d8f7279d87806c2b306a964eea4ac2c3bbcd130626ec9c7c

Observation a46f973f-e86c-4b9f-b8a9-760a270f4d53 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.841385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.841385Z digest=sha256:8f22fa44d3d627d7a9af946909e042760650c9cd1fdf78b724362c5ab42dcbe4

Observation 193390f8-8d51-4a20-b2b2-95fd9b87b584 · outbound

This paper cites , Wang, X.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Wang, X

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.470547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.846136Z digest=sha256:7c19ea84c251ff9e182b4963bf20c530ff2778b7e9eaab3f8bc1ecb0f8301a7a

Observation 0f224f9f-de6e-4098-9ee6-b6eaf20ae96a · outbound

This paper cites , Akrour, R.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Akrour, R

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.460082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.849639Z digest=sha256:46ea972294897cc222bffbb8d78967cee60b37db163171a4edfbaa1dc756ccfe

Observation 6ac8b3d7-f922-475c-90a3-b515381819d9 · outbound

This paper cites Thinking LLMs: General Instruction Following with Thought Generation.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Thinking LLMs: General Instruction Following with Thought Generation

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.853182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.853182Z digest=sha256:bd380fe6963237984abe8e99d51f56dbcb123c56181ec05191e773cfbc89318a

Observation a5176a8b-2654-404c-8c7e-8d5dffea658c · outbound

This paper cites Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.857312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.857312Z digest=sha256:1ba3386603953dd003355d4ceb93d4a0939704b5b9b2898d30f2f8221350464e

Observation e6eaa9e3-9d0c-49ee-8e68-723767c6d4ed · outbound

This paper cites , Dong, H.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Dong, H

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.448888Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.860987Z digest=sha256:26392480c7ba6eab5dcf773e5b3f1816adfb0ebc4ddc7973fcc7c80807639dfd

Observation c1bbd0eb-be0a-4ae8-a025-c575ab95b5a9 · outbound

This paper cites Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.864753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.864753Z digest=sha256:1f77f03118b42313b04436f10114404f23c90aa5d08e03585a3779a809d20563

Observation 97d25e46-9135-4172-abc4-086e621ded5e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 63

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.437483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.868820Z digest=sha256:a3dead2e54d738a8620b60a067b0b53cf295a0c76686ce698f62b4927a16e3e8

Observation fb8064e9-6ee5-4253-b617-d46507295611 · outbound

This paper cites , Yuan, Z.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Yuan, Z

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.426606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.872491Z digest=sha256:4051c186cee336eb015831d9b35136b690613f06302ceea97d03467ea8c933f8

Observation df65259c-c2ad-4ef7-82ad-33f70ca13d76 · outbound

This paper cites Scaling Relationship on Learning Mathematical Reasoning with Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.876480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.876480Z digest=sha256:d8738c25ec64e1bd88245ea5be0966123a335f6a9ef3887c4a192d1d934697a3

Observation ca3a54d8-a7a4-4565-a00f-50fe56e15759 · outbound

This paper cites , Broder, J.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Broder, J

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.414787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.880535Z digest=sha256:206bb5bf8e181ed440fa236649a624b27bb181def47f0395971352d20f47d6ff

Observation 1b78eb62-5aa6-4a1f-8fa7-1a7b1656599a · outbound

This paper cites Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.884354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.884354Z digest=sha256:ab19ea832ee46b0f429830797f47f8f143e15c7d445fd96bfacd79eda3522bed

Observation 55d621d8-cd0b-4354-bb79-c27b975fce8e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.403647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.888368Z digest=sha256:9beb2a12dc96664e81e282fb93af4635524c4b5efc0abd2ee066c479e78adc66

Observation 6626d737-9273-44dd-8a96-e0c78418a57c · outbound

This paper cites Self-Exploring Language Models: Active Preference Elicitation for Online Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Self-Exploring Language Models: Active Preference Elicitation for Online Alignment

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.892177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.892177Z digest=sha256:7f723879478e3af51b6583f6c303883570ee67542657dbe945771549eb3e4a67

Observation fb60df69-5da4-4d2d-bc3d-6c928af3da1a · outbound

This paper cites SLiC-HF: Sequence Likelihood Calibration with Human Feedback.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.896255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.896255Z digest=sha256:78ae7c0effc418669f7b235c3f2b8c6dee18b597f347c29842022348fadebced

Observation 63bb8363-8867-4ca0-aea9-6a5f3b3bc8d3 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.900296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.900296Z digest=sha256:b9bc7385f33bbac0ba34ea13a367ce74144d2308ffb691693c8fd97261e252b2

Observation 382c6597-fd53-485d-a35b-5538f21be0c6 · outbound

This paper cites and Zhang, T.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning and Zhang, T

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.392595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.904125Z digest=sha256:3979b1ddae519273ab688054f7f9c7486aa291b42986e93a8eb0bbbb070d58e2

Observation 532a7815-7590-4e2e-a506-67d220f9bc43 · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.908011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.908011Z digest=sha256:c77bda5d209f9a59345ccd0e4907091f571588ebd36a6031f37a2c2459d2f5da

Observation 78233f4f-7b02-42c5-beef-72e651f43288 · outbound

This paper cites BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.912444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.912444Z digest=sha256:4c4d4c16dfea58f0acb7436b7c5e8754325dca441a46c2aaa6ae9627a0155295

Observation a2f2438e-2787-4bec-9c2a-07bbaa81917b · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Fine-Tuning Language Models from Human Preferences

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.916248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.916248Z digest=sha256:c2a74d1da6f12afb075895ee7fd9bbea9fa56dc3e87eabd4c0a6df4ac1cfe359

Pith citing papers

Observation 2db48d62-948b-4d88-9904-14bf4e78f52e · inbound

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning cites this paper.

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

Reference 71

Resolution
verified exact
arxiv_id, observed 2026-05-21T14:04:11.994596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-21T14:03:48.795572Z digest=sha256:a971aa40176ec578094196c2caee6013ffa5de8006243e119f3a399b4f9e209e

Observation cbaa069c-3f96-4ae6-9091-b92dcfc68acc · inbound

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning cites this paper.

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:06:05.172360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T15:09:29.657563Z digest=sha256:be9beda028dff0904647aa501ddac90fda4418b2251d266caa6ba15315d1ac56