{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c85be375266cb0ced4fc64010cedf033eb00da49684945fd4e74351b42effa1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:57:30.462207Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.461679Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T09:34:04.394588Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2403.07691"},"observation_digest":"sha256:5a1ebc90117d5496095d9dec91e5c03af5e24f9b3efa02a708b93d0f993ff270","observation_id":"28bd4512-e841-440e-9f47-4f4374a6446d","resolution":{"observed_at":"2026-05-16T09:34:04.809974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-07T15:04:40.606818Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16475","last_updated":"2025-05-22T10:03:05Z","snapshot_observed_at":"2026-08-07T21:58:45.356145Z","submitted_at":"2025-05-22T10:03:05Z","title":"ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:40.606818Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2505.16475"},"observation_digest":"sha256:e6c783aea689037df2c52356d5c3bfeee22814df73e30e203e638886d6632a34","observation_id":"db0cbb67-4e25-44f8-8137-86ad2df344de","resolution":{"observed_at":"2026-08-07T15:04:40.606818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:23.895430Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:d54049f082e01cb9a60120f6016439d451b7da0d6fa4790caab5ad07f300a567","observation_id":"146c8736-2eec-4e14-a68a-1608ba13afdb","resolution":{"observed_at":"2026-05-12T06:01:25.233251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:49.322744Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:3f93d951967d9b7396dfe96bd05b7c9766779c0af6c7eb786c6602a906e4ff10","observation_id":"935ec621-b806-41bb-8664-74fac4b71b8c","resolution":{"observed_at":"2026-05-20T22:49:10.282952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:951024e9fee485d39050e7eef98da010a439dcd15ea44ef9db35fd60256edeb1","observation_id":"bb69859f-194a-438b-a684-327ef2e2384c","resolution":{"observed_at":"2026-05-21T11:24:08.664516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.29625","last_updated":"2026-05-28T08:59:55Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T08:59:55Z","title":"Improving Collaborative Storytelling with a Multi-Agent Framework Based on Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:19.786202Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.29625"},"observation_digest":"sha256:cf98541d3189478e0e307f05045b0c9ac3c21924986af8a5e898129eeca40fa2","observation_id":"5b85f5bf-8ad4-41b0-8a03-48eef99ed6c6","resolution":{"observed_at":"2026-06-29T07:43:14.199980Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:3f537d7d4704178eff7a7b007595eb61ebfb14f8a9e47370242e5a2630a6afb4","observation_id":"6911b7cb-e2a2-4332-af9f-7fed2b06b107","resolution":{"observed_at":"2026-07-01T20:56:13.463123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-08T00:57:30.462207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.462207Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:7f63d596d637d2c1837d99d8c9e96cc34d303548e142fcce5c35c94778e35d70","observation_id":"a1838133-bd51-4c1f-bf27-58ee53ce2e5c","resolution":{"observed_at":"2026-08-08T00:57:30.462207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.14483/citation-record","integrity":"/paper/2305.14483/integrity","json":"/paper/2305.14483/citation-record.json","paper":"/paper/2305.14483"},"outbound":[],"paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2305.14483."}