{"as_of":"2026-08-08T20:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:014604af175c21823451daabb0632ac07df1176643dbecc975d6455be6f777c2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:39:19.638204Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T22:46:53.836788Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-08-07T04:39:19.638204Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10341","last_updated":"2026-06-06T22:57:41Z","snapshot_observed_at":"2026-08-08T08:29:58.445590Z","submitted_at":"2025-06-12T04:35:02Z","title":"Formalizing Learning from Language Feedback with Provable Guarantees","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:19.638204Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2506.10341"},"observation_digest":"sha256:0d3088d7dd72108b92d238c7957cb1e3348b540959f100d0b659041afdb749c7","observation_id":"2cfbac60-fb60-47ee-984a-50b2db981f06","resolution":{"observed_at":"2026-08-07T04:39:19.638204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":"2504.16078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"net/forum?id=Ti67584b98","venue":null,"work_id":"f1a2c975-24ad-465c-b6e4-a188575d3bd9","year":2025},"citing_paper":{"arxiv_id":"2508.13654","last_updated":"2026-04-21T03:24:34Z","snapshot_observed_at":"2026-08-04T00:45:12.282530Z","submitted_at":"2025-08-19T09:04:13Z","title":"Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T22:42:53.663354Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2508.13654"},"observation_digest":"sha256:21977488c7be87dec7c34f1ea7dff5800acbc67bbe9c76be030736adae92665d","observation_id":"4c83c026-a8b5-43f4-a14b-5811fa35562b","resolution":{"observed_at":"2026-05-18T22:46:53.839788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-08-05T11:39:10.915427Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02655","last_updated":"2026-06-03T16:39:45Z","snapshot_observed_at":"2026-08-08T16:33:40.592861Z","submitted_at":"2025-09-02T15:13:14Z","title":"BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:10.915427Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2509.02655"},"observation_digest":"sha256:e482b9c9e02ce88cdf2e763b217a4bb243330d1f8c7f356d00f80d48a5eb20aa","observation_id":"e54cfaec-b1ea-4af7-98bb-e3953fd075ed","resolution":{"observed_at":"2026-08-05T11:39:10.915427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-08-03T03:04:44.260995Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities.arXiv preprint arXiv:2504.16078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.260995Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:7a1739a69b707cebf1785d64ff5181238e96744368f54609e4a557edf6faa3c9","observation_id":"7f3f4b64-5821-422e-aa76-1762997041e2","resolution":{"observed_at":"2026-08-03T03:04:44.260995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":"2504.16078","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"net/forum?id=Ti67584b98","venue":null,"work_id":"f1a2c975-24ad-465c-b6e4-a188575d3bd9","year":2025},"citing_paper":{"arxiv_id":"2604.05859","last_updated":"2026-04-07T13:20:06Z","snapshot_observed_at":"2026-08-03T16:43:40.161272Z","submitted_at":"2026-04-07T13:20:06Z","title":"When Do We Need LLMs? A Diagnostic for Language-Driven Bandits","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T18:32:12.396568Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2604.05859"},"observation_digest":"sha256:5d860460ec62e9ec957f1aa150465ca4ad7da60d1c112c8c405b5dc6164ccb0d","observation_id":"0d15c79b-652e-4827-8e3f-80ee1f170659","resolution":{"observed_at":"2026-05-11T00:25:51.144607Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-07-14T09:17:00.467000Z","title":"Llms are greedy agents: Effects of rl fine-tuning on decision-making abilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10789","last_updated":"2026-07-12T14:42:57Z","snapshot_observed_at":"2026-08-05T22:38:50.022731Z","submitted_at":"2026-07-12T14:42:57Z","title":"Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T09:17:00.467000Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2607.10789"},"observation_digest":"sha256:4368503c2710376239919b1b6fca16db9c038406ea36820176e3daccfb6493af","observation_id":"873fc6ac-4908-48fc-8314-28b34b99ae4a","resolution":{"observed_at":"2026-07-14T09:17:00.467000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-08-02T04:42:06.208989Z","title":"Schmied, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13618","last_updated":"2026-07-15T09:08:27Z","snapshot_observed_at":"2026-08-02T14:36:13.285477Z","submitted_at":"2026-07-15T09:08:27Z","title":"STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:06.208989Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2607.13618"},"observation_digest":"sha256:212192cdc2e3c777680ff912c7af1d42daf9702b4847d81f5452da38ae9dce28","observation_id":"c59bc3ed-e23b-4c20-98d8-65a1280885ea","resolution":{"observed_at":"2026-08-02T04:42:06.208989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16078","snapshot_observed_at":"2026-08-01T18:32:47.083166Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17281","last_updated":"2026-07-19T14:59:12Z","snapshot_observed_at":"2026-08-06T23:14:17.339421Z","submitted_at":"2026-07-19T14:59:12Z","title":"AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T18:32:47.083166Z"},"links":{"cited_paper":"/paper/2504.16078","citing_paper":"/paper/2607.17281"},"observation_digest":"sha256:2099820b397213b289155525b2de07ebf5cbdca40998c426a08435c1db344c6e","observation_id":"ef0fa664-70fc-401c-a58f-fe810392e29e","resolution":{"observed_at":"2026-08-01T18:32:47.083166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16078/citation-record","integrity":"/paper/2504.16078/integrity","json":"/paper/2504.16078/citation-record.json","paper":"/paper/2504.16078"},"outbound":[],"paper":{"arxiv_id":"2504.16078","last_updated":"2025-04-22T17:57:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T16:00:09.188009Z","submitted_at":"2025-04-22T17:57:14Z","title":"LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2504.16078."}