{"as_of":"2026-08-17T21:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:497ee32d36f17c50fdebbe999bc1fef6977048e2adeb9c853c81bab2582605e8","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:18:57.117932Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:14:56.115834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T07:55:58.659031Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2511.02130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.02130","snapshot_observed_at":"2026-07-27T01:19:51.926662Z","title":"Re-forc: Adaptive reward prediction for efficient chain-of-thought reasoning","venue":null,"work_id":"df5c73e8-8eaa-44c2-9229-9a0f2239d393","year":2025},"citing_paper":{"arxiv_id":"2604.09741","last_updated":"2026-04-09T23:27:46Z","snapshot_observed_at":"2026-08-12T19:08:46.072373Z","submitted_at":"2026-04-09T23:27:46Z","title":"ExecTune: Effective Steering of Black-Box LLMs with Guide Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T16:55:34.091812Z"},"links":{"cited_paper":"/paper/2511.02130","citing_paper":"/paper/2604.09741"},"observation_digest":"sha256:07da50de8082709bef2c522414afcc692ee77febd5b36379d3a2bbe50fd9436c","observation_id":"f0dec1ea-6bae-4e41-9e5c-fc8c872d320b","resolution":{"observed_at":"2026-07-27T01:19:51.926662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.02130","snapshot_observed_at":"2026-08-01T23:14:56.115834Z","title":"Ivan Zakazov, Berke Argin, Oussama Gabouj, Kamel Charaf, Alexander Sharipov, Alexi Semiz, Lorenzo Drudi, Nicolas Baldwin, and Robert West","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15516","last_updated":"2026-07-17T00:03:47Z","snapshot_observed_at":"2026-08-17T14:06:30.468615Z","submitted_at":"2026-07-17T00:03:47Z","title":"Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:14:56.115834Z"},"links":{"cited_paper":"/paper/2511.02130","citing_paper":"/paper/2607.15516"},"observation_digest":"sha256:d5f52717aa23534a45a4ed0f808f35b4adff17af897c41a745eb1c7c327263c7","observation_id":"bb75c710-b8c2-4b17-a3fb-8b8755367b24","resolution":{"observed_at":"2026-08-01T23:14:56.115834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.02130/citation-record","integrity":"/paper/2511.02130/integrity","json":"/paper/2511.02130/citation-record.json","paper":"/paper/2511.02130"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.533694Z","title":"Ai agents as universal task solvers.arXiv preprint arXiv:2510.12066, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.533694Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:3c260d64b58a554f300d3c45b45927c1b2217a44265c094d2e731ab9d6f503e5","observation_id":"f5f1fd78-4430-4e0e-ac5e-84d4fb6dc945","resolution":{"observed_at":"2026-08-04T00:18:49.533694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.599504Z","title":"Weitzman","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.599504Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:8bbc7519b464f7275bf5152ce7d596d62ea65ecebf64555b45df83f22d5068a2","observation_id":"1db28879-e705-457d-83c9-00e7e1ecf568","resolution":{"observed_at":"2026-08-04T00:18:49.599504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.699031Z","title":"Adaptive inference-time compute: Llms can predict if they can do better, even mid-generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.699031Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:2bc6aa78ca0cabae6a1d7157241f5ded2851553719a37adb5135f42a47b2aafe","observation_id":"bd9cd0bd-75a9-48d6-97a4-71af8ceeefd8","resolution":{"observed_at":"2026-08-04T00:18:49.699031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.775735Z","title":"Learning how hard to think: Input-adaptive allocation of lm computation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.775735Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:212a4935c8eefb3ff9f555897f3c22f21b2c0e43c898734249a5ea83cc31e266","observation_id":"ccf52c75-4cac-443f-a8b2-64846505a4cd","resolution":{"observed_at":"2026-08-04T00:18:49.775735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.852359Z","title":"Reasoning models know when they’re right: Probing hidden states for self-verification, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.852359Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:8e2d42ec654c17ba916e1e9d0f31263b50bfb6f720c1f8c28ae65a1c6dc9da51","observation_id":"53c0d873-76fc-450a-8992-79d35b225291","resolution":{"observed_at":"2026-08-04T00:18:49.852359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:49.927869Z","title":"Reasoning models better express their confidence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:49.927869Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:23b5f154745893dad57b97c3770d392b921a8227b04d76457f117ba7ec456cb5","observation_id":"53cf6160-9e1d-4a0c-9523-245d0286e0ba","resolution":{"observed_at":"2026-08-04T00:18:49.927869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.016662Z","title":"Are the hidden states hiding something? testing the limits of factuality-encoding capabilities in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.016662Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:73e8cfe82c64ef1a4b0cf0fb8b517a35ffbd449838297065824bed2d2a5efac3","observation_id":"359544d3-9c10-4bf9-a124-4a4cd27c01d5","resolution":{"observed_at":"2026-08-04T00:18:50.016662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.155089Z","title":"When do llms admit their mistakes? understanding the role of model belief in retraction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.155089Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:0bb5254860955b6ec313f01382adf4e5a0f66140c70a2262828b94c20dc64476","observation_id":"34f2f98f-f6b3-428b-b689-b550b46683a8","resolution":{"observed_at":"2026-08-04T00:18:50.155089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.231644Z","title":"Latts: Locally adaptive test-time scaling.arXiv preprint arXiv:2509.20368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.231644Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:2cb70f14065c55f2eb5364a28dc83c043d6912efe06c47171bf19062db976fe0","observation_id":"5a724d05-908e-4bee-8398-45c60272b5ef","resolution":{"observed_at":"2026-08-04T00:18:50.231644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-04T00:18:50.369476Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.369476Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:68ebbcf18776b76ca8913d91a1a7b3109de39cbe3a421126c2cee75aa0cd6d36","observation_id":"72151895-ca52-432b-9685-02026352fb2f","resolution":{"observed_at":"2026-08-04T00:18:50.369476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-04T00:18:50.448154Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models.arXiv preprint arXiv:2408.00724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.448154Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:2a5431ebcc4fa697a89751f1786d2ff306b03b698a0198579327f844d3999ab0","observation_id":"1e54afe1-de7c-44d9-906e-b06c25480fb8","resolution":{"observed_at":"2026-08-04T00:18:50.448154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.548821Z","title":"Scaling LLM test-time com- pute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.548821Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:b30fd1a3a47b02b5d364dbefe120dfbd1665326d7120ab3a3443da957556c349","observation_id":"aa48d2f6-f530-4deb-8886-e05eb718ca7d","resolution":{"observed_at":"2026-08-04T00:18:50.548821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.669264Z","title":"Adaptive test-time reasoning via reward-guided dual-phase search, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.669264Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:9f123d9ca95df632127e13acefa322f5d37de8d28a664fb34c9d6d55dc5f8c68","observation_id":"f8c97bc6-fce8-421c-b125-72039548985e","resolution":{"observed_at":"2026-08-04T00:18:50.669264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.797975Z","title":"Large language model guided tree-of-thought, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.797975Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:9274e898c52e613e095b94c5039190b1a38793ee32c49c62c3e116f3c62bb3dd","observation_id":"ae526caf-3e4d-4de6-b8b5-eb699ef6a94b","resolution":{"observed_at":"2026-08-04T00:18:50.797975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:50.950726Z","title":"Demystifying chains, trees, and graphs of thoughts.IEEE Transactions on Pattern Analysis and Machine Intelligence, page 1–20, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:50.950726Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:16900ee41ddff28025b27b371c1ba11b219b62c4034afe26cffe87bd276a6bc9","observation_id":"5d41821a-9f60-4e60-b9fe-846a52318582","resolution":{"observed_at":"2026-08-04T00:18:50.950726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.109409Z","title":"Fractured chain-of-thought reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.109409Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:f046c868eea6777fa6fa5deeaf542eb4d634e0db1911cd5b9fab25ef94cb6f97","observation_id":"1af5f92b-81d8-444e-b9a8-c22d24af9fd0","resolution":{"observed_at":"2026-08-04T00:18:51.109409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.200061Z","title":"Don’t get lost in the trees: Streamlining llm reasoning by overcoming tree search exploration pitfalls, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.200061Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:a67bb214c09b2777126b612bd75a57c090dc46474d45859840616e493ef7294f","observation_id":"cbb725a0-d7fd-455e-bbb9-b7d8ba2d640d","resolution":{"observed_at":"2026-08-04T00:18:51.200061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.332541Z","title":"Bartoldson, Bhavya Kailkhura, Guillaume Lajoie, Glen Berseth, Nikolay Malkin, and Moksh Jain","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.332541Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:21202930ca3592beea87d17d6341df06fb5d7360a23fc94f70ea0f65366f0c8d","observation_id":"7edc85e4-7976-4528-b532-6a187fd755e5","resolution":{"observed_at":"2026-08-04T00:18:51.332541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.452615Z","title":"Self-consistency improves chain of thought reasoning in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.452615Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:58e96f5a3ee1fefe4b214145a5b2fa543aa30abed8980c2dd767a4523edcdb81","observation_id":"1c9fc4d1-f4ae-4db1-8b35-db2c43c619c8","resolution":{"observed_at":"2026-08-04T00:18:51.452615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.600118Z","title":"Escape sky-high cost: Early-stopping self-consistency for multi-step reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.600118Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:7591433b3d16bc71de0a88a973c39345f8107ec591257d52326783ce7e196047","observation_id":"5ee55051-6514-46e4-ae26-65709cad83f3","resolution":{"observed_at":"2026-08-04T00:18:51.600118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.746637Z","title":"Answer convergence as a signal for early stopping in reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.746637Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:f6d8bf863a847143a03e914a38c7aebefc9c9922913742ce2d70797dee530c69","observation_id":"9b90644e-ca83-4203-95db-ef85405e3824","resolution":{"observed_at":"2026-08-04T00:18:51.746637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.816973Z","title":"Confidence improves self-consistency in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.816973Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:064ad86794e9af07d1148448582eb06eb00e9aab5aa5680799cc3b5d2d8b1e84","observation_id":"6e3f106b-c4fb-46cc-bf93-d812c01ccb67","resolution":{"observed_at":"2026-08-04T00:18:51.816973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:51.977267Z","title":"Best-of-∞ – asymptotic performance of test-time compute, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:51.977267Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:d70c8c3718a1ef8099dfab409f376ee0a6bce4f3f004b675d79aa9ddda7b246f","observation_id":"4730e179-e366-476e-9708-c5e5dc94f702","resolution":{"observed_at":"2026-08-04T00:18:51.977267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:52.103823Z","title":"Reasoning at the right length: Adaptive budget forcing for efficient and accu- rate LLM inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.103823Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:d1ebd53c907e8b2953fa8ed7f99d8b37cec5eb160fca059ab792b17eb92f6ba1","observation_id":"14182385-0dc7-4179-946d-681866ef5ecf","resolution":{"observed_at":"2026-08-04T00:18:52.103823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:52.246411Z","title":"Stop when enough: Adaptive early-stopping for chain-of-thought reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.246411Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:9d46fedbde863fae117008bf38a02744885af24f31ffae5cf8551a0663dfeae7","observation_id":"50983a61-6450-40ed-9b1b-860b734e1e3b","resolution":{"observed_at":"2026-08-04T00:18:52.246411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:52.376737Z","title":"Dynamic early exit in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.376737Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:7d073f0c3727c130db773fa04b9bd0685b4f6e8675e81d764665e93585191e84","observation_id":"786d86cd-dad1-49bf-ac6f-aa3878570218","resolution":{"observed_at":"2026-08-04T00:18:52.376737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-08-16T19:00:33.294322Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-04T00:18:52.530409Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning.arXiv preprint arXiv:2412.09078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.530409Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:3a70afc875a7c1a52100d22cfa1d8d3c285e38eb0e5991c2b331469511ed1e96","observation_id":"e90d3606-b78c-489a-81de-17a3eeb9a798","resolution":{"observed_at":"2026-08-04T00:18:52.530409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:52.631413Z","title":"Tran, Yi Tay, and Donald Metzler","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.631413Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:a259161a71abe8291db5174ed1e57461f97e31239cc81a00e5350019461e9e27","observation_id":"8fac33f9-86a4-40b1-9d76-1a8c282ee0ec","resolution":{"observed_at":"2026-08-04T00:18:52.631413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:52.737449Z","title":"Learning when to plan: Efficiently allocating test-time compute for llm agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:52.737449Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:dcb5cfbc334d5cb1fb8f2483be3749f823d4723f74487c0aa2db0c540b8892f4","observation_id":"a5ba5b92-8e66-4071-9a31-398b90ffd545","resolution":{"observed_at":"2026-08-04T00:18:52.737449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.001575Z","title":"Can past experience accelerate llm reasoning?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.001575Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:49a20770eb1146cadbf5e784fd6cb328f3f25f3ce26746c0217ab126d4bac213","observation_id":"29133d63-4fb1-4801-b915-ed33260db601","resolution":{"observed_at":"2026-08-04T00:18:53.001575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.107261Z","title":"React: Synergizing reasoning and acting in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.107261Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:17097a933a7288273452a0bd75d93e0d4c9f2afb50e2e8bce50491dc488d15c6","observation_id":"42fde987-d5d5-4d4e-82bc-766c6e28def9","resolution":{"observed_at":"2026-08-04T00:18:53.107261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.250671Z","title":"Least-to-most prompting enables complex reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.250671Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:fbcde43fc95c1fd13ae2908cdcea3d35a16ed94f1669e6d4423c705e50d4905b","observation_id":"502e8052-b4a4-4805-ac2a-00ddbdb5d318","resolution":{"observed_at":"2026-08-04T00:18:53.250671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.423313Z","title":"Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.423313Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:e706aa47770c76ffe8a4574a1762d6280e5aebe493b4fe4a7096c03ed04b26d8","observation_id":"d98bd29e-8f15-4604-956c-bcb3abe0727e","resolution":{"observed_at":"2026-08-04T00:18:53.423313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.463678Z","title":"Universal model routing for efficient llm inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.463678Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:e516f89ac3894f39ab19259614124e245928fb640a5a0313dce06c7728037b31","observation_id":"8de295ef-7984-4c33-bc11-e214f6843e6d","resolution":{"observed_at":"2026-08-04T00:18:53.463678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.570113Z","title":"Chen, Trevor Chow, Ishan S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.570113Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:867f5875194c367983a93908ada40accf2178d85555b957b3d82725e388da25c","observation_id":"52014968-b680-4f54-a462-cd365e95e27d","resolution":{"observed_at":"2026-08-04T00:18:53.570113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.732069Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.732069Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:2ce7ce88b5875bde73e0747a257177eebb47300aa34b8201a217986c430a6995","observation_id":"c1b60305-9969-42f8-904b-927d5a51531a","resolution":{"observed_at":"2026-08-04T00:18:53.732069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:53.845979Z","title":"Masrouter: Learning to route llms for multi-agent systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.845979Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:f4bdbf1d73d1f41ba365d636957f4e56bc48ca82a1dfc5e300f69ab7ca02d54a","observation_id":"ca0799a4-3655-4411-b409-7ab04b4e427b","resolution":{"observed_at":"2026-08-04T00:18:53.845979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T00:18:53.941103Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:53.941103Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:6ae52d993382d52b0c24ce92c9c521e1137e099ff375049873cdadabc4320aa0","observation_id":"49389cfa-613c-4591-9906-3d8ea5d3bb7b","resolution":{"observed_at":"2026-08-04T00:18:53.941103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-04T00:18:54.094174Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.094174Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:f6eff62935edcb66785de7e6bef47663170df3ca4cf91c5f60f0951e7496d5c9","observation_id":"461006de-6502-44d5-9090-9cc057fb52ca","resolution":{"observed_at":"2026-08-04T00:18:54.094174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-04T00:18:54.255096Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.255096Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:4f690fc38a6749039703cdc42ada4719a5a54934fc837e71b90bc0fdcac5d9de","observation_id":"5aeae402-b595-4ac6-9205-079dbeecfc93","resolution":{"observed_at":"2026-08-04T00:18:54.255096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:54.377086Z","title":"Principles of metareasoning.Artificial Intelligence, 49(1):361– 395, 1991","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.377086Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:a55b613cb1f359c9449e94aff4a51d49764595d1f98f511a681d3c12002c63a8","observation_id":"46964432-08f6-40e2-a2e4-ce7ad8318d7b","resolution":{"observed_at":"2026-08-04T00:18:54.377086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:54.497296Z","title":"The pandora’s box problem with sequential inspections, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.497296Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:b4b48096df3dd6f8bcf0db29d04e6759a84d68db163ae1a2d0183c43511925ce","observation_id":"7ce641b3-6d8b-4131-809f-8e601a04b7b2","resolution":{"observed_at":"2026-08-04T00:18:54.497296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:54.620933Z","title":"Deep think with confidence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.620933Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:edbf086d69c19f99efd8fe7ecfcae8e4c3f46131c43e50dc0e83baf00fa5e7c9","observation_id":"b88aa7cf-08a9-41a3-a704-77c681a8e40b","resolution":{"observed_at":"2026-08-04T00:18:54.620933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:54.816578Z","title":"Ai agents as universal task solvers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.816578Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:a3522b12410d0b43468dee8c0401bf76bb0b50fafa2b00979f62d3899b9bf66f","observation_id":"a166893a-e424-4399-b681-c8af805d54fc","resolution":{"observed_at":"2026-08-04T00:18:54.816578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:54.922794Z","title":"e1: Learning adaptive control of reasoning effort.arXiv preprint arXiv:2510.27042, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:54.922794Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:b36012a2b3d38c66689a29928f9138095ac584ac0b029e998dfa7909603632f3","observation_id":"88938956-2678-4966-9976-67728ff3f64c","resolution":{"observed_at":"2026-08-04T00:18:54.922794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10872","last_updated":"2025-08-01T22:10:35Z","snapshot_observed_at":"2026-08-10T21:24:33.891894Z","submitted_at":"2025-06-12T16:38:51Z","title":"The Gittins Index: A Design Principle for Decision-Making Under Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10872","snapshot_observed_at":"2026-08-04T00:18:55.114608Z","title":"The gittins index: A design principle for decision-making under uncertainty.arXiv preprint arXiv:2506.10872, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.114608Z"},"links":{"cited_paper":"/paper/2506.10872","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:b9b9d86015ec0d4be018f027dadca6fab13e21e98cd723f81420bd79f2c9db3c","observation_id":"239240b7-4603-44f3-822b-e4624ea5bcb9","resolution":{"observed_at":"2026-08-04T00:18:55.114608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.255548Z","title":"Universal sequential search problems.Problems of information transmission, 9(3):265–266, 1973","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.255548Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:aadf617d1c3a51ce24d95eeb7456badccd91846e9eda5fc9b6ab39797e5a0aa3","observation_id":"c6ed65eb-277e-4737-803b-9ef798223146","resolution":{"observed_at":"2026-08-04T00:18:55.255548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.395824Z","title":"Department of Energy, 1978","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.395824Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:2e281e6921c66473794ddae2899457f4a27cf3a2ae63d3a882750bfbe049ce02","observation_id":"b562c7ab-0e52-477a-a83e-14e5b193da90","resolution":{"observed_at":"2026-08-04T00:18:55.395824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.472999Z","title":"Cost-aware bayesian optimization via the pandora’s box gittins index.Advances in Neural Information Processing Systems, 37:115523–115562, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.472999Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:d12636e7cafa59e203ecfff57c6e39d8bb607277b16bea36c5f0cc7c0014e008","observation_id":"a548a6c5-dc39-4541-aa40-c141511a0b3e","resolution":{"observed_at":"2026-08-04T00:18:55.472999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T00:18:55.559048Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.559048Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:9bfb5bc6e20693a2ed4a5bc7771e9f79f48bce9ac5b6fa065b0b986d594e07c9","observation_id":"18455bb8-e886-4175-b0d9-53b30b46fa39","resolution":{"observed_at":"2026-08-04T00:18:55.559048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.692856Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.692856Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:dbe325b1ff08563de1dcbef7523215f54b6841c216c67bacb0ac5f368c5b0841","observation_id":"b01a01f2-1f88-415d-b189-f12636591218","resolution":{"observed_at":"2026-08-04T00:18:55.692856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.809995Z","title":"2024 amc 12b — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.809995Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:1e64bea412d72a40e19e02cefcf0ffca19bbfef8a2f917631b9cf216faaea9fb","observation_id":"70cf59c5-d901-4c73-8691-fbc6a7a6970c","resolution":{"observed_at":"2026-08-04T00:18:55.809995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:55.923446Z","title":"2024 amc 12a — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:55.923446Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:117b1c790ad8feee96628121902c00c1d3fc78a65917302a2f7a02beda3f7773","observation_id":"4de28b56-f962-4df9-a4b5-7642a9198805","resolution":{"observed_at":"2026-08-04T00:18:55.923446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.049118Z","title":"2024 amc 10b — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.049118Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:69ce32e85629f68a30edeed9bff58d9561520b90e1a11a89dfd918b04009fbde","observation_id":"2219d362-364b-43fe-bfb3-b9b214c1ab7d","resolution":{"observed_at":"2026-08-04T00:18:56.049118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.171172Z","title":"2024 amc 10a — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.171172Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:95d48d8c6a2413bdc3e42dcdfda63078c6893e859bbdc6289fbe8d6b41fa0b20","observation_id":"4292be6a-bbac-4e26-b594-7ec140183df4","resolution":{"observed_at":"2026-08-04T00:18:56.171172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.300191Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.300191Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:8a177da73d654698ec09a95562c54d022608b65a424a94839eca912997d597a7","observation_id":"43dff967-fed9-4e4c-b231-887db9ce705a","resolution":{"observed_at":"2026-08-04T00:18:56.300191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.479317Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.479317Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:1d8fad2bd00c1d689b128a70407bc35eaf61d3f629499b0a5d4f45b60ddc5c14","observation_id":"e53748f6-761d-4301-a84b-647029e547c8","resolution":{"observed_at":"2026-08-04T00:18:56.479317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.651338Z","title":"2024 aime i — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.651338Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:540a68dea087acc098e41ef0278ffa2733b3cc9754967f55aad052e3ae896a3f","observation_id":"30257503-5cd5-49c0-9a65-d9a58e30e44c","resolution":{"observed_at":"2026-08-04T00:18:56.651338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.825467Z","title":"2024 aime ii — problems and solutions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.825467Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:3545b1170683dc3b23d137286d9b0b0d8d29eb8aea09ebc5e2e164bee92a9ec3","observation_id":"8e18e2b8-bc6b-42ce-b133-dc20326ce6ff","resolution":{"observed_at":"2026-08-04T00:18:56.825467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:56.973166Z","title":"2025 aime i — problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:56.973166Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:775c4a6a848d712f857714ef8d51d360eee4c632de43314821a293eaaf8ea15b","observation_id":"80d71ef5-bd30-4ff2-ad38-578f17acc464","resolution":{"observed_at":"2026-08-04T00:18:56.973166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:18:57.117932Z","title":"2025 aime ii — problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T00:18:57.117932Z"},"links":{"citing_paper":"/paper/2511.02130"},"observation_digest":"sha256:714851e1632884cee1b1a8f1aa0aa932dbbd084a513fc096fd89b014749bdb8c","observation_id":"fcb2e03b-2cad-49f6-a32f-1fe44b5feecc","resolution":{"observed_at":"2026-08-04T00:18:57.117932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.02130","last_updated":"2026-07-24T02:10:35Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T03:06:58.402631Z","submitted_at":"2025-11-03T23:47:49Z","title":"Re-FORC: Adaptive Reward Prediction for Efficient Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2511.02130."}