Pith. sign in

Paper Citation Record · LEDGER

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

As of 22 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2501.18858.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.18858 v2

Coverage vector

measured 75 of 75 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T22:20:13.916248Z

measured 78 of 78 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:59:21.921798Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-21T14:04:11.992913Z

Reference resolution

75 of 75 outbound references displayed

  • verified exact1
  • verified fuzzy20
  • unresolved54
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 71fe9c34-df1e-4b17-9400-6858973e54b0 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.633401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.633401Z digest=sha256:5475bd08a62ed7be7e0c3c4a2968dafdf9fb7f8e2beebb098e4c4f3fe7eeb4d2

Observation f088fb5a-aa32-4ba1-b6f6-40ddfa2d5c88 · outbound

This paper cites write newline.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.638251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.638251Z digest=sha256:a4c95feefa1cc6da6970cf42446917a059c6bc8a4af2598fe4f05ec2e8df39e3

Observation e195ca26-6f57-4561-a9e6-10b2291ecac7 · outbound

This paper cites , Kakade, S.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Kakade, S

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.717422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.642400Z digest=sha256:9ca63418dfaa97ffdffb28b32799eed90919d4cbe3fb3361b1a191a8b242df86

Observation cc7719bf-d893-4b2c-9b03-bb40bf57eeff · outbound

This paper cites Introducing claude.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Introducing claude

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.706690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.646165Z digest=sha256:b77aad050934e348ebc0213f49170e584ede7983aaec504d8b56ab81ca007f21

Observation 076e2db7-4171-4cf5-828f-5616832b49de · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.696409Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.649958Z digest=sha256:75d9480a41530927f302762e2ed5bd75012ef5e2797a862568fce9d5ed2df472

Observation c2fe5741-70da-4570-9461-16546785e7d0 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.686335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.653870Z digest=sha256:ac6d681966d99d3e4a7987bf023acaeb2337ad258482ba145678907a091f0f7c

Observation 5be4c4d4-88dd-4f67-810a-34f71bdeafaf · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.676919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.657733Z digest=sha256:2844bada9d1ed728b80eda8e5b6c774be62863a1c46f5c1878a1fd355ef6b2fc

Observation 170f180c-bcc1-4a58-a02a-a38eebec5602 · outbound

This paper cites , Yang, Z.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Yang, Z

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.666702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.661470Z digest=sha256:191c10058a197ef75239816a6302e7f0a0389259f3c3d76bd49193df9c25f3bf

Observation f9fc7748-358f-4432-9874-7940b231297f · outbound

This paper cites Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.665416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.665416Z digest=sha256:5a055725e41afbea5bd58660f829e0e51496ab084252f92b19dc29e4eb0798fb

Observation 28fc5344-66f0-4006-81e0-516a0875b960 · outbound

This paper cites Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.669361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.669361Z digest=sha256:de91430ab5be528612b481ce2a25b7654b6fb7f11a5ef500e13007db166d34ce

Observation b907da4b-ebc8-4c88-ba8f-7e61c58abe4c · outbound

This paper cites , Zhong, H.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Zhong, H

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.656454Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.673021Z digest=sha256:fe6a42dd5bbf7e8d498b391efa2c7af4b5fc1f10158d1ebd5db92e7b5669874d

Observation 151f09de-fc19-4add-b169-4ab3a373d826 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.645632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.677216Z digest=sha256:a278273a2467155b7144a9acbc8188ff927d0405cfff25a3973d2f5c6f791c2d

Observation 99a9f4d3-1a24-4259-bb1a-f77dd1726b1d · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Training Verifiers to Solve Math Word Problems

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.680732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.680732Z digest=sha256:0b4f5834650155dea8133683c13867fdc952e33ca192602f8b332048f9b2a2cc

Observation cee18fd6-77cc-417c-9f2d-271f43a01737 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.635329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.684721Z digest=sha256:9446abbae2110f72f687d4dd7d931c8c4d045b6ddd8d8f6a81f03beab0715df0

Observation 9c860370-c1f9-429c-8617-95cc1eab5d8a · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.687997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.687997Z digest=sha256:393e12c6244ea431574fcf13bfd132433bd316f6b2c6da721d7157347d5d0a1b

Observation 6eac74c1-acf7-456a-abaf-aaef16daf23b · outbound

This paper cites SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.691866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.691866Z digest=sha256:059a94d6f2b4827f6289fd7c72253ee664cc8b3085d723e4fb55a2d0ca52e6bc

Observation b9e83fa6-3446-46d5-9f24-12ff698aa7ba · outbound

This paper cites Reinforced Self-Training (ReST) for Language Modeling.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Reinforced Self-Training (ReST) for Language Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.695913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.695913Z digest=sha256:6fe27b24b0dd8f8d8225684bc333bd2060742abc1a815d4ab3b12db3f2a91476

Observation 1a1b9781-fcba-44e3-9fae-0bc47470c146 · outbound

This paper cites Efficient (Soft) Q-Learning for Text Generation with Limited Good Data.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Efficient (Soft) Q-Learning for Text Generation with Limited Good Data

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-08-09T22:20:14.320291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.699639Z digest=sha256:087a027dbc309b61cbcbe1ac1642dfed5d5a53eb8a2e57f9cbfaae3e8bd20e26

Observation ce2ba8c8-db78-404f-8dd7-5ee390bc2fc5 · outbound

This paper cites , Luo, R.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Luo, R

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.625702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.703511Z digest=sha256:c2378ad093c6be267d11dca907cc5f6cc4f7fd01fda9053ba843fca4e2093616

Observation e8e0d51b-a1a0-47f0-aea8-e03856666c41 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Measuring Mathematical Problem Solving With the MATH Dataset

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.707110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.707110Z digest=sha256:052bf70f084e9cbfdd32d6092d1231f20add35292e62eb645a4ee5615e93200a

Observation 6a29718f-ea22-443e-b189-5f8fbc076a78 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.615720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.710609Z digest=sha256:f54a8ed8c178ec57d763c2b2ad23fd157d45ab134b5373f534cf445528543564

Observation eaa27419-dfab-48d9-b8e1-6d3854144ef1 · outbound

This paper cites Amortizing intractable inference in large language models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Amortizing intractable inference in large language models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.714127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.714127Z digest=sha256:f1256cda871c0a8f6c1133193cc0243873c35a65c46a9fbae87c74ab06e33a67

Observation ff84e239-6f43-4fc3-b2a0-022f6d2f7eba · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning LoRA: Low-Rank Adaptation of Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.717907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.717907Z digest=sha256:0137573af22e906908c313a765f8d0e00e2aa280481fb62a12f288583f24254e

Observation 4eb03066-89ec-4e72-aa4b-7c294afddd0e · outbound

This paper cites OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.721525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.721525Z digest=sha256:d7365ccf76ff4a9b450dcb6774a509eefeb8c670cea1ec8489412931506abfbf

Observation 44582844-d450-4503-8a37-055ec5a81c52 · outbound

This paper cites Mistral 7B.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Mistral 7B

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.725354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.725354Z digest=sha256:ed8e13c21e136093a401c9d6907c3af0c8f35460b742e427bb4fff36ac6b8499

Observation 4a724be0-ae5f-4b59-910e-f24b32fe265d · outbound

This paper cites Auto-Encoding Variational Bayes.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Auto-Encoding Variational Bayes

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.729025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.729025Z digest=sha256:fa4a740a99f4bc1df1fa1af4c303c0a6b9c56878c878d47c319021fc516e3dba

Observation 36a3b135-0549-4268-8b52-487fbe993c53 · outbound

This paper cites , Andreassen, A.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Andreassen, A

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.605799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.732483Z digest=sha256:edfef09211b2d3c81abb1d8bfa42633b43ae75e69e2d9439a7cff5e79e35d7b6

Observation 929b64d2-b666-48b7-907c-3b72e02f23cc · outbound

This paper cites Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.735791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.735791Z digest=sha256:daa618eddaf0cc5c6fbb86f85287a524d390db5496914c5afe19113d3bd90aa3

Observation b8548978-17ef-4388-974f-449abcdc1b19 · outbound

This paper cites , Xia, C.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Xia, C

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.596306Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.739386Z digest=sha256:eb571aff172fd1b67a105ec37ca186ab6b4fb7b3f7911f1bda83d8259af44e17

Observation 9bef8d91-24eb-4dc5-ba50-9ed4ec2f475a · outbound

This paper cites Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.742905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.742905Z digest=sha256:272eb51b7fdb4a86281e444e118b68ca5cc3037c7d00fc3c7f2e84798b2db333

Observation d572741f-2b18-400f-a600-756f41ebd414 · outbound

This paper cites , Welleck, S.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Welleck, S

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.586300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.746900Z digest=sha256:411ef95683261d1fc73c5b16c17e7f85ded41f1694a2112447b8778533fb99b0

Observation 13d63a5c-4fc6-4abb-bc32-cac1fb86f9fc · outbound

This paper cites American mathematics competitions amc 12, 2023.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning American mathematics competitions amc 12, 2023

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.576757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.750668Z digest=sha256:155f4a7ad08937019758e7618592f45a5c5926a1297d84bc944252818566d632

Observation ce58649c-b0fe-470a-9320-6ea26684665d · outbound

This paper cites American invitational mathematics examination aime i & ii, 2024.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning American invitational mathematics examination aime i & ii, 2024

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.566487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.754406Z digest=sha256:9a586604bd4b629eb6bf7867b36e4e366d8a2da68c6708cef44d798168ebe043

Observation 458f3f4d-8e64-4e03-a712-f8cf3b0258cb · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.758075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.758075Z digest=sha256:50059e55fd613124f03fbc88e859b754f8b0bc07738887bb32efe7ceee8aa19a

Observation 42f46a88-af47-4f23-bb01-2739bb19f89f · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.555846Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.762198Z digest=sha256:119a1122c748949b42fdd0d9504919f847eb2b940f915cac27dad1b3d062ce70

Observation 9658b0a5-77e1-41f9-a48d-c7eb74e19c51 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.545400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.765945Z digest=sha256:0689b0091121d68fc36906c8af78c2f58a5b68e309d204f1a89557c4e30bea2a

Observation a10dae46-7f57-4acc-8641-b3ce9b95d4b5 · outbound

This paper cites GPT-4 Technical Report.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning GPT-4 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.769921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.769921Z digest=sha256:245af4e4119ec88c8d159501398729f4d29191e2743a290e4a607241be532970

Observation 3c16a765-d8b0-4f94-8105-b30e3de67077 · outbound

This paper cites Introducing openai o1.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Introducing openai o1

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.534173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.773819Z digest=sha256:0b88c14055f54785af9bc6d29a45a41207a5e4ab81feedac2cd5a68cf883d21b

Observation d211d0d1-ca8b-41ef-a3d7-0f54e36df2c1 · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.524244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.777649Z digest=sha256:4944f44813bdedc69c5c3e23273de81e8c8eb330770aa19efc75b5b5f30af420

Observation d4263822-9942-4e16-8e67-8b2d01b6219e · outbound

This paper cites Dueling RL: Reinforcement Learning with Trajectory Preferences.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Dueling RL: Reinforcement Learning with Trajectory Preferences

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.781528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.781528Z digest=sha256:8c88947f2cd49352a28ee856eeae68f008eff905b88c9efb863d6a5fa2eb7e5e

Observation a61768a3-3504-445c-926e-4a5e1debd6ff · outbound

This paper cites Iterative Reasoning Preference Optimization.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Iterative Reasoning Preference Optimization

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.785735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.785735Z digest=sha256:2074ba2ee1b080906bf778adb3ab1e9cfdf37627dc94d331c02df933eef7b848

Observation 431f54c2-b983-4d6d-8d7d-9f937680a2a5 · outbound

This paper cites , Sharma, A.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Sharma, A

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.514047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.789876Z digest=sha256:1d3d735bd84c279ce3a841d512b0a87a8e259b619dec7e080745aabe06c92a13

Observation 3744cd2a-5353-45e9-8a3d-3be015f6689a · outbound

This paper cites , Hou, B.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Hou, B

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.503355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.793488Z digest=sha256:c04c95e9c7d8d020f231879282a08f7059e45dd7a769d8be5e499508daeca54e

Observation c97db65f-60d2-4741-8838-efd8c12fa671 · outbound

This paper cites and Ritter, D.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning and Ritter, D

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.492894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.797176Z digest=sha256:c5eec0b97f76cc8257629671fb0318a06f79ad762ebada51b3e788d9d0d32052

Observation 8257da74-90e2-406d-bb78-062204fe394b · outbound

This paper cites Proximal Policy Optimization Algorithms.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Proximal Policy Optimization Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.800921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.800921Z digest=sha256:94cbcf75e2b42d0c35fb32a3e5763fd04dff44b2f0730f2dc968ff5e6e53cdae

Observation 9e171bc6-a046-41e4-8d1b-7dd9151dacf6 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.804411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.804411Z digest=sha256:90005564caf65d689a6ec5a1cb792d051998d2c05645f9c50ba89b0b8f63cf89

Observation 25cc60a7-c4c1-42d8-b73c-5dae2eff1877 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning HybridFlow: A Flexible and Efficient RLHF Framework

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.808058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.808058Z digest=sha256:a193d2d47abb315f99d9fc88a4cb235a029c2ad7c62c34bbc9f3d0e545d69b0f

Observation faeffd8c-00fd-4ec4-83ba-5d5f2b921b3e · outbound

This paper cites Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.811949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.811949Z digest=sha256:65e0ad106aa1da669e32d557304450a39662b990ba6938c365988b7e91f53cc9

Observation 4c74fd54-2b9a-4647-92cc-30d5b6ce3259 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.815878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.815878Z digest=sha256:4ec227dde8cc31f92b2d682a50c7d366e2ea26ce1f45f728a9b17a4be30f7608

Observation 57ef5985-b31d-4716-bd89-10a02249b3a5 · outbound

This paper cites Generalized Preference Optimization: A Unified Approach to Offline Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Generalized Preference Optimization: A Unified Approach to Offline Alignment

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.819384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.819384Z digest=sha256:8eafe57c727d30881f28dbb2752633a6b13b3dacacdf11e15c501a2a90e1c487

Observation 371b0358-3e5e-47bf-b084-665a4e7d832a · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Gemma: Open Models Based on Gemini Research and Technology

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.822920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.822920Z digest=sha256:3d76118394bf0068a26fb9221e13af9a6417386d69b0b710dd43d7e4d72ea958

Observation 778fdd76-1f49-48ed-a34c-9bd0cda5bd47 · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Gemma 2: Improving Open Language Models at a Practical Size

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.826434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.826434Z digest=sha256:1b8c1273a4e26c09a04efa9502a678a255abd562c58bf996c94aa737bfe707b6

Observation 58af0572-2bab-4f77-bac4-e589513b151e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.481196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.830168Z digest=sha256:73fe1e2318e50c2ab2de66bcb5f2dc29d56457e659a0483cbfa5e514d343678d

Observation e6f7e4bb-c600-4fb4-ac47-f7579670accf · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning LLaMA: Open and Efficient Foundation Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.833736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.833736Z digest=sha256:03f7cb27bd6c25e7b1489d4f9a62233542196c55a49e93dbcb1134def4fa3a1c

Observation 5f1be69d-e707-456a-8242-d80ec7109be4 · outbound

This paper cites Offline Reinforcement Learning for LLM Multi-Step Reasoning.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Offline Reinforcement Learning for LLM Multi-Step Reasoning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.837391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.837391Z digest=sha256:646d066dfc57be18f5643d0020c0f34c59833c0e609be76dfebf2260b898139d

Observation a46f973f-e86c-4b9f-b8a9-760a270f4d53 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.841385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.841385Z digest=sha256:6f5528beb83b0e1238bec7f3a63a7cbead562b7b675558e72f240950ad5bbd7b

Observation 193390f8-8d51-4a20-b2b2-95fd9b87b584 · outbound

This paper cites , Wang, X.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Wang, X

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.470547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.846136Z digest=sha256:a3247e18b4a7047096fec7a164da4b2b75ba02ce87498cbcf52c7bee3ba09249

Observation 0f224f9f-de6e-4098-9ee6-b6eaf20ae96a · outbound

This paper cites , Akrour, R.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Akrour, R

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.460082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.849639Z digest=sha256:4eb75bd5e12105ab6ab17813525871a3e95cf3849b9dfa2d9c50761f24aa39a8

Observation 6ac8b3d7-f922-475c-90a3-b515381819d9 · outbound

This paper cites Thinking LLMs: General Instruction Following with Thought Generation.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Thinking LLMs: General Instruction Following with Thought Generation

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.853182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.853182Z digest=sha256:00884ab31d36128031165babf645e41c24ab6d7992a6b07dadbcb72e9667a65d

Observation a5176a8b-2654-404c-8c7e-8d5dffea658c · outbound

This paper cites Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.857312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.857312Z digest=sha256:5b85187eff19231222ecf307621b6641a0c0c56025fc65ea2d66788775da01ce

Observation e6eaa9e3-9d0c-49ee-8e68-723767c6d4ed · outbound

This paper cites , Dong, H.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Dong, H

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.448888Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.860987Z digest=sha256:7a8645da83904a31a208765b6f4660f9afbcff0304cdf56225f7ae16308983ec

Observation c1bbd0eb-be0a-4ae8-a025-c575ab95b5a9 · outbound

This paper cites Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Rewards-in-Context: Multi-objective Alignment of Foundation Models with Dynamic Preference Adjustment

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.864753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.864753Z digest=sha256:3aa4802c4e2aeadda3427e03977d014542ff80ef21247c30201a71e2dfa661b3

Observation 97d25e46-9135-4172-abc4-086e621ded5e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 63

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.437483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.868820Z digest=sha256:943895f0b33847b42b746f8d949b844cdda6780347fd63f949814aaa90f5b01b

Observation fb8064e9-6ee5-4253-b617-d46507295611 · outbound

This paper cites , Yuan, Z.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Yuan, Z

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.426606Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.872491Z digest=sha256:395751a69323535c7513ce3574c500fa18c1fe3a89c8a0d7071136557c8d3fef

Observation df65259c-c2ad-4ef7-82ad-33f70ca13d76 · outbound

This paper cites Scaling Relationship on Learning Mathematical Reasoning with Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Scaling Relationship on Learning Mathematical Reasoning with Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.876480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.876480Z digest=sha256:e9ed45479bf653b5112502fb66869075ad0bedad2b533b99284e285d7a493fc5

Observation ca3a54d8-a7a4-4565-a00f-50fe56e15759 · outbound

This paper cites , Broder, J.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning , Broder, J

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.414787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.880535Z digest=sha256:13e342b5c8a5ab7f18164da8ed988d4f06063393694638e63927f810435e2cd7

Observation 1b78eb62-5aa6-4a1f-8fa7-1a7b1656599a · outbound

This paper cites Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.884354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.884354Z digest=sha256:63edff9510708efc9c9651752818b069301c893528f60092e2c200708f1ddd2d

Observation 55d621d8-cd0b-4354-bb79-c27b975fce8e · outbound

This paper cites an unresolved cited work.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-09T22:20:14.403647Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.888368Z digest=sha256:e172360c87c7bf248bcc07d457cd2a6bfe8561599387f34cafbb27e4ea8cc23e

Observation 6626d737-9273-44dd-8a96-e0c78418a57c · outbound

This paper cites Self-Exploring Language Models: Active Preference Elicitation for Online Alignment.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Self-Exploring Language Models: Active Preference Elicitation for Online Alignment

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.892177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.892177Z digest=sha256:d363095a86b66d83369d0fcd8ff5ab3b12ca5c11da0f3212b8da01f4f228f7b3

Observation fb60df69-5da4-4d2d-bc3d-6c928af3da1a · outbound

This paper cites SLiC-HF: Sequence Likelihood Calibration with Human Feedback.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.896255Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.896255Z digest=sha256:dae5efc31da8127bc22f11aebcb2aaf5e0f19496e765223061c381141eadbce0

Observation 63bb8363-8867-4ca0-aea9-6a5f3b3bc8d3 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.900296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.900296Z digest=sha256:e9610734747e1658345866ec76f756f2dfc1b3fbfa8474d4ac7cc1741b066965

Observation 382c6597-fd53-485d-a35b-5538f21be0c6 · outbound

This paper cites and Zhang, T.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning and Zhang, T

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T22:20:14.392595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-08-09T22:20:13.904125Z digest=sha256:6c7c89c94fd508496e79e28c24bfba052ca15a872b787f30c90da64aa582de9b

Observation 532a7815-7590-4e2e-a506-67d220f9bc43 · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.908011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.908011Z digest=sha256:1a22531d619e2a3f5a1411083b6901e42469c0e7d3f00eb560d17c356236e1e3

Observation 78233f4f-7b02-42c5-beef-72e651f43288 · outbound

This paper cites BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.912444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.912444Z digest=sha256:0bcba114b8c4133dad03eb8ee80af5269756cd737f2deba747636b1cced720e8

Observation a2f2438e-2787-4bec-9c2a-07bbaa81917b · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning Fine-Tuning Language Models from Human Preferences

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-09T22:20:13.916248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T22:20:13.916248Z digest=sha256:222f031b2eb1b13e9f49c2c0a6e9386dedce6c443f8910c2756acf294008a44e

Pith citing papers

Observation 2cfbad54-1637-49cd-8e82-8848fae86640 · inbound

Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL cites this paper.

Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-16T00:59:21.921798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T00:59:21.921798Z digest=sha256:d6e286d71d0f88bfb5ff4b4c72e6d11fb71c6a5afd0a7dfcc78479f5c16c23d4

Observation 2db48d62-948b-4d88-9904-14bf4e78f52e · inbound

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning cites this paper.

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

Reference 71

Resolution
verified exact
arxiv_id, observed 2026-05-21T14:04:11.994596Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-21T14:03:48.795572Z digest=sha256:10120759d371479eaede81d2bd25421aa9556f142f69274da86092dfcbd7a89b

Observation cbaa069c-3f96-4ae6-9091-b92dcfc68acc · inbound

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning cites this paper.

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:06:05.172360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-10T15:09:29.657563Z digest=sha256:b5aa0cff0c43c972cd5558d841aff7b247c2fc02aec59cb6774e61fdf8572ebb