{"as_of":"2026-08-07T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fc8ee633902be358c426b53ae7cedbf75e6e23478b8b4afd75c077219ab27be","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:43:26.153787Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:12:55.978703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T03:26:29.328767Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2510.24636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.24636","snapshot_observed_at":"2026-07-02T03:26:29.328767Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","venue":"cs.CL","work_id":"cd2b8a5f-5d71-4806-b44e-e889c42f37f7","year":2025},"citing_paper":{"arxiv_id":"2606.03963","last_updated":"2026-06-09T15:09:32Z","snapshot_observed_at":"2026-08-05T23:50:00.007370Z","submitted_at":"2026-06-02T17:50:15Z","title":"AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:03:54.185019Z"},"links":{"cited_paper":"/paper/2510.24636","citing_paper":"/paper/2606.03963"},"observation_digest":"sha256:05ddc8a67284ac1ce1d6d1bd42ab1ec6ac1de604fde114aafd4017b06e30990f","observation_id":"2fa5c8cd-2e1d-4666-a6ab-e196f6207750","resolution":{"observed_at":"2026-07-02T03:26:29.330841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.24636","snapshot_observed_at":"2026-08-04T15:12:55.978703Z","title":"2025 , archivePrefix =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02097","last_updated":"2026-08-03T11:58:21Z","snapshot_observed_at":"2026-08-06T23:36:53.142190Z","submitted_at":"2026-08-03T11:58:21Z","title":"Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-08-04T15:12:55.978703Z"},"links":{"cited_paper":"/paper/2510.24636","citing_paper":"/paper/2608.02097"},"observation_digest":"sha256:f798fa92c5ccb57a29a152e121ced2932d2e896eb6f2935581075b608cf2497c","observation_id":"f31f01ec-4405-47ac-808b-e0a1c6ec45da","resolution":{"observed_at":"2026-08-04T15:12:55.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.24636/citation-record","integrity":"/paper/2510.24636/integrity","json":"/paper/2510.24636/citation-record.json","paper":"/paper/2510.24636"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.18940","last_updated":"2024-10-16T18:37:15Z","snapshot_observed_at":"2026-08-05T11:52:00.055185Z","submitted_at":"2024-07-10T18:00:03Z","title":"LitSearch: A Retrieval Benchmark for Scientific Literature Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18940","snapshot_observed_at":"2026-08-04T07:43:23.166612Z","title":"Lit- search: A retrieval benchmark for scientific literature search.arXiv preprint arXiv:2407.18940,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.166612Z"},"links":{"cited_paper":"/paper/2407.18940","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:7e2a98e97bb35f0730c10006378ee6f0de4928040325a42ab57735cfde88bf4e","observation_id":"4017fda2-d60e-4662-ab92-ced0d4c72468","resolution":{"observed_at":"2026-08-04T07:43:23.166612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-04T07:43:23.842667Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback.arXiv preprint arXiv:2310.01377,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.842667Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:032b758930dbb230e56251581324178cca375dcfacfbe8f9f18c876e49fe5198","observation_id":"a669659d-eb68-4d3f-b5f3-51fdfb80fb1c","resolution":{"observed_at":"2026-08-04T07:43:23.842667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-04T07:43:23.975882Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.975882Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:e1bffe384dd510cd4067735eaea079eea2fbc242d3bf811b52a8f8997f34eca9","observation_id":"0d203271-3140-4f3f-baaa-ff3b3defe4d4","resolution":{"observed_at":"2026-08-04T07:43:23.975882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T15:27:40.795834Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T07:43:24.151892Z","title":"Reward reasoning model.arXiv preprint arXiv:2505.14674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.151892Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:2ca9d7ab859ef66c1703960bec3716d4829993f3e0a2a671366274701d61b2f3","observation_id":"c37af3d7-af75-4336-af67-24164bd603c7","resolution":{"observed_at":"2026-08-04T07:43:24.151892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T07:43:24.321802Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.321802Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:7ce0c839206e4c62cb8054b7592d861c1d083ef294186f138a23fd5718e7352c","observation_id":"4536026d-9fbc-432f-ab63-f788f4e274dd","resolution":{"observed_at":"2026-08-04T07:43:24.321802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T07:43:24.471106Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.471106Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:7c6775ba693e70a8e28625c5a9c352129f198046dafa08e896d67e1ca59edab6","observation_id":"9c9888e2-16e0-4a62-a3a7-75b701758423","resolution":{"observed_at":"2026-08-04T07:43:24.471106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T07:43:24.665067Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.665067Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:98c07febff4ac63b4d1b01815634987ad3bf7d75431f90de79ee445d4502881c","observation_id":"bb48b874-e55b-4f2c-8572-c3f6a9ed6cb4","resolution":{"observed_at":"2026-08-04T07:43:24.665067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-04T07:43:24.808467Z","title":"Llms-as-judges: a comprehensive survey on llm-based evaluation methods.arXiv preprint arXiv:2412.05579, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.808467Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:10e57844a9b9f3e86c62ceb865c00a5bbf6329580333d261b20998e01ce35b51","observation_id":"2ec46496-2ed5-4882-87c3-f8db1312b954","resolution":{"observed_at":"2026-08-04T07:43:24.808467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T07:43:24.944019Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.944019Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:e842bc714496c5d80eda1dc6ad4d3419be5efe35ef67da10ca50e04d2cc6a46b","observation_id":"76c6d061-bfe2-4bd6-bed9-7a813641a7a9","resolution":{"observed_at":"2026-08-04T07:43:24.944019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01488","last_updated":"2022-07-10T17:28:51Z","snapshot_observed_at":"2026-08-04T03:36:33.710054Z","submitted_at":"2021-12-02T18:38:50Z","title":"ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01488","snapshot_observed_at":"2026-08-04T07:43:25.107788Z","title":"Colbertv2: Effective and efficient retrieval via lightweight late interaction.arXiv preprint arXiv:2112.01488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.107788Z"},"links":{"cited_paper":"/paper/2112.01488","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:a0226329d232c09bdbe11d333793dd8e8871dd0ac8dc6575201995129e455787","observation_id":"0825a5ca-74e1-48e8-97be-1945e1419bf0","resolution":{"observed_at":"2026-08-04T07:43:25.107788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:25.470188Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric Xing, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.470188Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:a3a8f4192999a3048b63fa74ecbeda5f54d2af04469d9201de2b2b552d7f5299","observation_id":"df821748-0ef0-4ed6-a211-7d8dc675b0d9","resolution":{"observed_at":"2026-08-04T07:43:25.470188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-07-06T21:04:06.413573Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-04T07:43:25.595789Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environ- ments.arXiv preprint arXiv:2504.03160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.595789Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:93a898ac95d9c954d091c547e49941f2b8c6f65157e4f78e16939751726c258d","observation_id":"620c362c-7cd2-42bc-ab82-327944e133cc","resolution":{"observed_at":"2026-08-04T07:43:25.595789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08569","last_updated":"2025-03-11T15:59:43Z","snapshot_observed_at":"2026-08-07T17:12:32.675735Z","submitted_at":"2025-03-11T15:59:43Z","title":"DeepReview: Improving LLM-based Paper Review with Human-like Deep Thinking Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08569","snapshot_observed_at":"2026-08-04T07:43:25.717056Z","title":"Deepreview: Improving llm-based paper review with human-like deep thinking process.arXiv preprint arXiv:2503.08569,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.717056Z"},"links":{"cited_paper":"/paper/2503.08569","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:56329d2f39a5ec6561c303f68f179b905a6cef8b21ed309d491e5468a51a7130","observation_id":"5494b6d3-cc63-4ce5-aa65-7cff8bc3b62f","resolution":{"observed_at":"2026-08-04T07:43:25.717056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-04T07:43:25.904052Z","title":"Ttrl: Test-time reinforcement learning.arXiv preprint arXiv:2504.16084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.904052Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:2ec174da5caf53751315ece0fc750fa3600c6fb69a87767b6a7fe1a1786a3c66","observation_id":"9154d8a7-6529-4d91-a2b9-cbb063127e87","resolution":{"observed_at":"2026-08-04T07:43:25.904052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:26.153787Z","title":"<search>","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:26.153787Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:873bd3538ce0fa97f308a98c180f806a835f044d0b9974ccd9ee88652635ef7b","observation_id":"d1803f90-09a4-43e3-9cd1-ab8b8054d950","resolution":{"observed_at":"2026-08-04T07:43:26.153787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T07:43:25.323549Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:25.323549Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:7c23a167e83ed67c08e8dbead8cc6126b7692788c4cc5e7ab9dbb381ce24e77a","observation_id":"0e72a6e3-9c4c-430a-b864-1cc7972b1e72","resolution":{"observed_at":"2026-08-04T07:43:25.323549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T07:43:23.625509Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capa- bilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.625509Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:be73cecdc531ee212e6fe5d062775cae8fe9d7798bd3f16de0dbd10f159c9df5","observation_id":"fe62aaab-6e99-4cff-a2d1-4f62d6b61ad2","resolution":{"observed_at":"2026-08-04T07:43:23.625509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:43:23.483080Z","title":"Judgelrm: Large reasoning models as a judge.arXiv preprint arXiv:2504.00050, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.483080Z"},"links":{"citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:ca0c12ff54602b3d59553331893854156855b83ac356b412c988081b601ab74e","observation_id":"277f7038-62bf-4de2-9117-c86f581cb9d5","resolution":{"observed_at":"2026-08-04T07:43:23.483080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08069","last_updated":"2024-09-12T14:24:45Z","snapshot_observed_at":"2026-07-06T19:14:21.092302Z","submitted_at":"2024-09-12T14:24:45Z","title":"TravelAgent: An AI Assistant for Personalized Travel Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08069","snapshot_observed_at":"2026-08-04T07:43:23.344859Z","title":"Travelagent: An ai assistant for personalized travel planning.arXiv preprint arXiv:2409.08069,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:23.344859Z"},"links":{"cited_paper":"/paper/2409.08069","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:152d9ca9a492aecb4dfc47b8f1e4e5e4a8a89fd240867946952b68dcab6555f3","observation_id":"6210a4bb-f318-477e-b054-a9acfed1291d","resolution":{"observed_at":"2026-08-04T07:43:23.344859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 2 inbound Pith citation observations for arXiv:2510.24636."}