Pith. sign in

Paper Citation Record · LEDGER

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 13 inbound Pith citation observations for arXiv:2506.14965.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.14965 v1

Coverage vector

measured 58 of 58 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T00:13:52.537874Z

measured 71 of 71 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 13 of 13 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T00:51:25.047158Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

58 of 58 outbound references displayed

  • verified exact0
  • verified fuzzy10
  • unresolved48
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 3138bf82-e82c-495d-a067-60bd336cd684 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:09.212352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:45.471782Z digest=sha256:4f99b3671629a596c1d8eeabea78ca1d505cc78deddf2c61bd7278b8f77c3c69

Observation 83a9bb53-ebd3-4115-8c44-f19668ce2396 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:08.923651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:45.582726Z digest=sha256:0aa63ddabce1ee88bfc25c5ed57f07431312b33945c571adeae8a677c8528663

Observation 71916b87-9b50-4dd0-b789-6164b85fbc6d · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:08.589369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:45.735745Z digest=sha256:794b7c05e2a19b4d19d7fbbad26743173abae6720a6bd096c09e3b34942202c3

Observation d0a1db52-a0ad-4743-aede-4cd590b43bed · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:08.285453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:45.902556Z digest=sha256:29e2fb042d24f1dc551c9a3f1e0e94747e959c362265c7ff4774aa057c1425c5

Observation 1fcbdfac-f309-4ad1-ab2e-818520f1635c · outbound

This paper cites Then, we need to find m + n.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Then, we need to find m + n

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:07.958355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.041924Z digest=sha256:189e77f3ff9fa62e165756e9a98b5bbdd73fd2a7325ef4717fa5a3f8f2d615f0

Observation 904a1ea9-7ff3-4a58-b939-a12268677ca3 · outbound

This paper cites It then iterates through each contest, checking if the rating update is allowed based on the division and the current rating.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective It then iterates through each contest, checking if the rating update is allowed based on the division and the current rating

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:06.357715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.807880Z digest=sha256:8e3dff8faae1865058933c8fdbcba261ce4c6aea6fe972d248e1d3601d67789a

Observation 606bc65d-bf7f-419a-bd0f-21ad666aa33e · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:03.469653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.631692Z digest=sha256:88c7121c7b2de0150b8d0a0d5bf38eeb751dd175334436dbe61a3f21dd65ea2c

Observation 8bad5977-fa9b-42e4-9682-e70077173bfa · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:07.688839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.164088Z digest=sha256:1eed0e36fc85ae749b47439149a1c5fd4e06e7932a8cfc1c011b43563486e0a9

Observation 90db118a-a375-4049-919c-501a5cedd94a · outbound

This paper cites 1 and Div.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective 1 and Div

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:07.506687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.266434Z digest=sha256:1c5382829af3038d4a24e2a2fe0b37a20bb2b24f4643d1eafbeeb5858ed15346

Observation 2e9b52ce-7861-462f-8170-1132ff8b69e2 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:07.180762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.441684Z digest=sha256:ba12c9ef64c2cad9dd15fe1306c6c890375c0de5e4fbda8b504a1859bf101705

Observation 3bd8f8df-6715-49d8-836e-75d60fa87122 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:06.899841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.558733Z digest=sha256:130bd430f2d6920480801c05ac706c855ffe373fc7e651adc777ab3a14ae49d3

Observation 4c39eab6-36d7-423b-93b8-3d96b128a135 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:06.651073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.683555Z digest=sha256:0e314366be5eb5e3e5badcac37a802555b7072190d0b6f3412833dc72e070ef4

Observation d5a7bc77-65b7-449c-8445-e1bba119cd06 · outbound

This paper cites Let’s re-evaluate the steps to ensure accuracy.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Let’s re-evaluate the steps to ensure accuracy

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:01.138253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.278736Z digest=sha256:9d6d1064dc0acb31756dd144d23f1ba091b0cf9737f984c9b6e1543f94d255aa

Observation 561eaa2d-27b8-4cd3-90e8-069caecd54e0 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:06.110374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:46.940775Z digest=sha256:e8e83ffe3468eda9c9296f2403736839ad1229998b55c26e60800b94f74066c0

Observation e5b81542-0dc0-42a4-9aff-88dcc6d10f33 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:05.509203Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.053183Z digest=sha256:1410639735c7403ec5115e0761435219a7c8fad46bebcf7004ff450b42b68ebe

Observation b8d5dc60-c242-4513-8d50-64d8f780a078 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:04.758704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.150869Z digest=sha256:edec4ff05552bb7987633f9af1bc275c6ff86b98c2ee73927fb201df5bc6465a

Observation d308de17-9e8f-45b7-826b-a31712440022 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:04.473637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.281545Z digest=sha256:4c22cb13c6f66a5de48dffd61c4351fee54c0dd23a6bdf7355eddfa5d5f3e606

Observation f5b18e92-3841-46a3-9fb1-638b46c2bfd6 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:04.118712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.394921Z digest=sha256:4f6e8a04ce2f8a8dccaa3e368643d542ca46b5b7b68b6e45237982c599c60035

Observation ccf1fad5-58cd-4759-ac53-005dc8641e56 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:03.767662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.497750Z digest=sha256:ad0b0098558015204654e127d354b10d8342cb48ef8abaf887ac9db827c2e8ae

Observation 79c8865c-3eb0-4ba2-88e1-675fa05812a8 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:03.237728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.779040Z digest=sha256:19289d4707b42a989b4011f5e99470b65355426d6969f77fe4a18c06a6e6b3ec

Observation 2df6be70-039f-445e-8351-8395f955c2b1 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:02.939028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.849093Z digest=sha256:24789779f87ce4bc4c9fcd06e20cc857b15cc4b509a64d16b217c551d043996c

Observation 8c2d2e3d-62a6-40d2-ae85-dcae07540fbc · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:02.685215Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:47.916450Z digest=sha256:426b9950233dd39a85c6ef71c52b2c6b23ee99c267eeb8f2595394660ef8258c

Observation 34521ad9-4368-4240-a31d-5f3518465ab0 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:02.531780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.010638Z digest=sha256:d0b4ceb84c5752add191c95b9adc87277776a40b575511a2ff7f7a5689dcb4e4

Observation 44c0796f-5a42-4105-9e5e-207ea3a16213 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:01.409899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.158982Z digest=sha256:c031ee36226fb174b42d93a1a30afa00c5d3c4f4567b6d12d5481874739fbb2a

Observation c8b8d9f8-62a7-46fb-b45b-320123b70775 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:00.891058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.362317Z digest=sha256:8f637aa7ff0ae3e3992c101dfe963437cb6bedbf7350f8f80f407ea6a7b165e0

Observation 9ceceaa9-03e0-4f6a-b932-678bdb381182 · outbound

This paper cites Your task is to analyze puzzles, spot patterns, and provide direct solutions.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Your task is to analyze puzzles, spot patterns, and provide direct solutions

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:00.629978Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.511657Z digest=sha256:b96d6e1dfa256e8654ccf7406f1c0acd5840964f84fda7cad48932f300b859a2

Observation d8d9ba3b-30a0-497e-9c0c-c1e794a98bfc · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:00.417362Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.651745Z digest=sha256:1d2f67358e2afeff869c02adcacd78cd40dc1221151cc2ce88c519d414ab09fb

Observation 13623a4e-18eb-42b3-b338-6baf05f91d48 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:14:00.185666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.801229Z digest=sha256:7d2df04e4e637da7dc89cd88bc5ab11b7a6462a86ef43987a282fd19cabf15fe

Observation dfea3190-e89e-4293-92e9-24e51bbe27de · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:59.962503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:48.962428Z digest=sha256:e0e631bdc7022b4fe50498399884b56561400ba9249a5f2498d8fb3eeb3fa5ab

Observation 33c17e1c-ce9d-45fb-8a53-b9cb09664b21 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:59.677211Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.110531Z digest=sha256:d8aadfbd4d6a20051abe9e100528608834fa6b1626a311329a38c050c2bdb98b

Observation 4b86bc8f-0d19-4976-b28f-5a63ca37dcc6 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 33

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:59.435392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.214779Z digest=sha256:1a7409af8dda59fd69b3159b9e13b81668b1257fd8a8350e589742e012443614

Observation c2431a87-37bf-480e-a23a-7bc492c49acd · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:59.138179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.351833Z digest=sha256:1eb38136aa1bdd3e6d87cccdcca474de8713b0f5d455e1059da9165880baa4cc

Observation 17b7b37a-ebb1-4681-987c-e4ecc4bc640e · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:58.882899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.481090Z digest=sha256:0f65b8662f736e3c9fe09e3432a59170e8c78adea9a5859be0c41d694bda1894

Observation bc407327-b6b3-475e-ba27-073ddf48cbcf · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:58.611425Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.599814Z digest=sha256:c55e124d68f3d3fa37b91d7c5c05b8414101030a7d26cf8e645abc0117563b3f

Observation e6204e8e-b5f1-4d90-af83-7d1015add0bf · outbound

This paper cites p u b l i c _ k e y.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective p u b l i c _ k e y

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:58.326281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.774594Z digest=sha256:3132c99a2de6211394a14e2ac4375c5587db4b11e70f546133358b974aec770e

Observation 31d903f8-0fa2-4c32-a3cf-612d280e13e5 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:58.046485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:49.906248Z digest=sha256:194913fd1954bf2a2e3498d2dca3bc2f630af55a6131fbf94513a7b1eb8a5163

Observation 9ff46a1f-bb33-4f72-ba58-af439a0d7337 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:57.795625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.085910Z digest=sha256:441d48cfebfd551fbd97fbac3934bfb0befd49bd4f228631bbff5022317985ba

Observation 54cf4116-2865-4cde-a7f6-343a9a6b0fd7 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:57.490070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.210072Z digest=sha256:5e0fb08d0be4dde1e8ad2dd2308d37d670bb984405d6d52311fdd1ac861efd3f

Observation 2dcc7f77-1bb7-43a9-871d-083c1146bc3a · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:57.301531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.365980Z digest=sha256:92b51666e606966e8ae3c150138423c7db1a9f6a0abd0b92c52054c3c9cfffbf

Observation 8662592c-77f6-4ca8-ac2d-de10044aa35c · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:57.101323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.476121Z digest=sha256:9112b64db1f8b710de49e9c1da7c2982d0bdd287ce37f9097a893ee77b5f1ffc

Observation 548e4237-aed6-4703-aad2-1c1b2f0113a9 · outbound

This paper cites The prime factorization of 901 is 17 × 53, so p = 17 and q = 53 (or vice versa).

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective The prime factorization of 901 is 17 × 53, so p = 17 and q = 53 (or vice versa)

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:56.912958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.616320Z digest=sha256:a7290c00a214bd3fdc8531646e58eead3bcf200e2232729f35115fe6a025e041

Observation 71f0f3b6-de95-4441-9b64-4f8793f176ba · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:56.720067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.769658Z digest=sha256:852e5cfd0bb818d5d3f2f0d83aec4f4adcb292768917361f1fb494dcae52fe95

Observation 40d3ce10-ab8c-4b2f-a6e7-ea8f0bf71a7c · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:56.466138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:50.900809Z digest=sha256:9d36c3bfde571b365eb05478fa6e586a2bdd63a50a12dcd2193a38d8417496bf

Observation e56162b0-1cf8-47ee-be70-183e190f68b5 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:56.208238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.009985Z digest=sha256:ecb84d9271ba833990f948f0969210c3189452ba47bf87cae04da15b7cfb033a

Observation 2e93df25-5d81-411b-99fc-5789220fec3c · outbound

This paper cites This means 3 × 555 mod 832 = 1.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective This means 3 × 555 mod 832 = 1

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:55.968485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.135289Z digest=sha256:afc36df427d9b24b72ef1a767a418cc4e487f841088e92c6737a0059befe5c64

Observation 53a754e9-234e-48cd-a62f-437d649cfbef · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:55.624048Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.261466Z digest=sha256:56b3b268d7dc9343d2b2071e024d88f63b6fb71d17e343471b2d7d214c1b115f

Observation c0cc73c5-82b0-4762-a70f-33b77bcb26fe · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 49

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:55.345857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.373288Z digest=sha256:b34073a0998d072d22a226c3198ee76ed36efc644e6b2ec333dba18500c7f5d8

Observation ea9d8924-6369-4f9a-b0ee-a2c5d2e6c470 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 50

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:55.067313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.494238Z digest=sha256:56499ac1fa9e301e3b3accd85bc92aa163655d163be53ea9a2f6aa37f2521667

Observation 95f034e0-584d-42e8-9b33-bf6f4229a4ee · outbound

This paper cites p": 17,.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective p": 17,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:13:54.820126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.655727Z digest=sha256:4c3d96a4733fe9015bd2d2ae791153b2c04b1a71148b740e0ccc3c5db336889a

Observation 011ddf69-08e5-4da5-9471-161c7b2226e8 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 52

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:54.560492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.772786Z digest=sha256:be7a309a0102af706311ca06847e33dc42adb0403d36a5d14ad16f7113c7dce7

Observation f50becb5-bb82-4d67-8e73-054a4081ad62 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:54.247177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.868126Z digest=sha256:4f76e86c88899c09f3e9f6efdfa0dc584bc5bc642265820df7a349781b295d91

Observation f3f10b22-49e6-4199-a844-39eeac744b0d · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 54

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:53.979526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:51.983302Z digest=sha256:20fc5cfe29ab521cdf3824fd47e89c4e0699d9617d0f23f3fa43b629e14b1097

Observation 032dd5d9-aaa5-4e80-a23e-aebea949cecd · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:53.717941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:52.163920Z digest=sha256:b9baff7a26f8ccebde6204a426e09046c3a82a4546ff335a3a714650b6b3769b

Observation 3fa4e05a-4bb8-4504-8adc-e482108b97af · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:53.366095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:52.267834Z digest=sha256:e62bbc1f9bb10603546ff87446b44a07b85b8557449bc3988f86708b078ca3ee

Observation 844fa836-7563-432a-90e9-589f1cb1b3c2 · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:53.068741Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:52.382382Z digest=sha256:9955a05ad3f5313aaf5af4487b15414f5eba3d9a689f3ea828f4ab5f3cb08e7e

Observation 066e2452-4e7c-4be8-a09a-ffa35138cf4f · outbound

This paper cites an unresolved cited work.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T00:13:52.822815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:52.537874Z digest=sha256:0d4b7c8b8f2458c2118aaaddaae1fd9f1bfec21b3961b230075fab64f5a8bfd3

Observation 84b07b2c-747b-41d3-bae5-54fa71256eed · outbound

This paper cites More specialized applications emerged with FinQA (Chen et al., 2021b) and ConvFinQA (Chen et al., 2022b), addressing TQA within the financial domain.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective More specialized applications emerged with FinQA (Chen et al., 2021b) and ConvFinQA (Chen et al., 2022b), addressing TQA within the financial domain

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T00:14:09.457129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-07T00:13:45.296738Z digest=sha256:ddd9c4239a6b226a12fd6a03aace9046284c70bfd238980129375791493dd43c

Observation c29a27ce-28de-41c8-a0e1-1ac2ecb79cfa · outbound

This paper cites Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought.

Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-07T00:13:45.222636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:13:45.222636Z digest=sha256:8c726266453257b9ca7c8b02e00e13c6b91d2d4ae7411115f5ed9b41892e91fc

Pith citing papers

Observation 27600c42-52c2-4520-8d41-a13110548b31 · inbound

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models cites this paper.

Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 127

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:40:41.992656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-12T08:40:40.910461Z digest=sha256:c2a160a0f9342703a7ca756e9a551e8b2ae13e15a81a01d6aa78b557b5d0a55b

Observation 23f41cff-96e0-403b-b367-604fc7bac8fc · inbound

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling cites this paper.

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:40:46.468912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-21T23:39:39.018498Z digest=sha256:b84db399b571c5741d36980094b72bc71e2625d08277c7c415390090fd86bd43

Observation 0e0d3d1c-e15f-453d-833c-25d07c6ef6d7 · inbound

Dream-Coder 7B: An Open Diffusion Language Model for Code cites this paper.

Dream-Coder 7B: An Open Diffusion Language Model for Code Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T12:56:35.030001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T12:56:35.030001Z digest=sha256:0520bee5b678c0dd8ea989316204e7d1dddb6597094cfe173f51c789c458927b

Observation 2b3e99fa-9b84-4a9a-b883-cf2046791ad6 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:25.174744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:d5230750d027bc56dbf2f9bc09659ce70b714a6f1915bf2b1440b1683353e795

Observation 0336c218-8eeb-441a-85a1-478bcc30418e · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:28.561884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:28.561884Z digest=sha256:48bc405dfdc8543f1dbc3dd1a136908a3dd5e7f6b4e8a8495e0e7cb845fde04f

Observation ef994c77-03b6-4084-9afe-6a46a4a4c9db · inbound

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward cites this paper.

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-11T06:10:59.816045Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T17:46:30.854129Z digest=sha256:127f2c203afd909e89c342ee5774b5d81f4c65577f16027e317e8f9551056d8d

Observation 67dcaf45-0935-4531-8b0e-08546f2e69e3 · inbound

CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts cites this paper.

CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 72

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T19:02:34.069072Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-28T19:01:14.340754Z digest=sha256:6addbfd1a761d92e959f1a740248e1c2efb5a4aeb380d4c3d22e3c510d7ca33f

Observation f25aea38-5b2d-48c2-9cec-93deeab9d4c9 · inbound

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning cites this paper.

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-06-27T01:20:20.557977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-27T01:13:11.483599Z digest=sha256:fc159f6206ed4c7bdb07f7a85b3f825ea8ddd8275113229fa0a8bb6691409ba7

Observation 93fb66b6-df41-4211-955e-23dc44cf4e4e · inbound

VIMPO: Value-Implicit Policy Optimization for LLMs cites this paper.

VIMPO: Value-Implicit Policy Optimization for LLMs Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-04T03:29:30.731893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T17:59:29.066879Z digest=sha256:9d6c788ce3aa8edfd255675a6dbd95a301c0a51cabd748abe2a963b6a2ec8d48

Observation 0b3f1521-154f-4fb4-9be1-f1a318a894d0 · inbound

Loop the Loopies! cites this paper.

Loop the Loopies! Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-01T21:34:28.015716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T21:34:28.015716Z digest=sha256:faa80e6ef4fd6c7990de1b9abf795fd9bc7a18b30a28258f4bfb00f1aa19cb7c

Observation 76885f17-4a3b-4958-9ea8-7305911faf1c · inbound

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL cites this paper.

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T14:50:09.878211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T14:50:09.878211Z digest=sha256:595e52c25a0467e07a9e7024ba96e759b5bb675cb802f3b1ba2946a21533e55e

Observation 6ff86dea-41c1-47b1-9ea2-89aaca1fd3c3 · inbound

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs cites this paper.

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-08T00:51:25.047158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T00:51:25.047158Z digest=sha256:85ef985be7b9a0272bee2750c17b701ed2dc9485ca8bd47cceaabbd82ed42d57

Observation e00d57f2-0c17-4e4c-b441-2e87735c546b · inbound

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning cites this paper.

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T04:30:38.938928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:30:38.938928Z digest=sha256:fdbaf235dbd604e698fe61b8ef98d558dc9638750a40e354db8b13e11cb6919d