{"as_of":"2026-08-08T22:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0cc0aefc9bcf089fac31515c9d652fa1d05c1b4179e496e9641ecef407fb62c","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:48:13.389900Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.10687/citation-record","integrity":"/paper/2511.10687/integrity","json":"/paper/2511.10687/citation-record.json","paper":"/paper/2511.10687"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.182497Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.182497Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:92e7a9b85e55f20b4694c43252e727b768ed3daf8de08081060deeb94f9c1b66","observation_id":"ebfb17e4-39e8-481a-8c56-62b9d8c4efc8","resolution":{"observed_at":"2026-08-03T22:48:13.182497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.286579Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.286579Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:b0453098b94f650434b81e083a4c974cad3b80c2a32f3a981c082f964b713426","observation_id":"7779f0d2-8a8a-461e-8760-1f5f4956eec8","resolution":{"observed_at":"2026-08-03T22:48:13.286579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.389900Z","title":"A.2.1 PLUGGING THE SIGNALS INTO POST-TRAINING Success route (RL-style).Use {ri,t} as per-message rewards for each agent policy πi","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.389900Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:37f5003860043849b5b7c28bb79ba47147f08c886f6cee39f02562494239455d","observation_id":"6d528103-0915-49a8-bde4-887ad2280f9a","resolution":{"observed_at":"2026-08-03T22:48:13.389900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:12.972733Z","title":"Hanhan Zhou, Tian Lan, and Vaneet Aggarwal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.972733Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:a11245c28d6e6cf746477e0e2701f6795a2a709856904a7e54c7fb7a85147b93","observation_id":"d8b051f7-8a88-452a-9f97-57fe3d7156d7","resolution":{"observed_at":"2026-08-03T22:48:12.972733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:48:13.075374Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:13.075374Z"},"links":{"citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:e4c0eca04101783a6175fade4c67133520635df93f369d685a588f7480a7ead5","observation_id":"4dbc5025-f6a2-4325-b958-526dbb994880","resolution":{"observed_at":"2026-08-03T22:48:13.075374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.4265","last_updated":"2014-02-12T22:51:33Z","snapshot_observed_at":"2026-08-05T01:10:24.481482Z","submitted_at":"2013-06-18T16:51:53Z","title":"Bounding the Estimation Error of Sampling-based Shapley Value Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.4265","snapshot_observed_at":"2026-08-03T22:48:12.451470Z","title":"Jacob Menick, Victoria Krakovna, Lawrence Chan, Michael Laskin, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.451470Z"},"links":{"cited_paper":"/paper/1306.4265","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:be640a09b4254e9bee9da698dd5fd48602664e144f4957fd0190fc3cbbda3694","observation_id":"9386696a-3c67-4049-beee-c373ae487399","resolution":{"observed_at":"2026-08-03T22:48:12.451470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14465","last_updated":"2022-05-20T13:52:54Z","snapshot_observed_at":"2026-08-05T03:08:42.211484Z","submitted_at":"2022-03-28T03:12:15Z","title":"STaR: Bootstrapping Reasoning With Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14465","snapshot_observed_at":"2026-08-03T22:48:12.820859Z","title":"Eric Zelikman, Yuhuai Wu, Noah D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.820859Z"},"links":{"cited_paper":"/paper/2203.14465","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:7216d54e3fa96c09101216ab62f8245fe8e5f817f7319376070bdfc755ec4c83","observation_id":"fbdf2d18-0fcd-47dd-a69d-c5e64652322b","resolution":{"observed_at":"2026-08-03T22:48:12.820859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-03T22:48:12.563763Z","title":"Joshua Owotogbe","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.563763Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:f39b5c96c087952e57ab42900338874d7863e19f0be2895edbcc8bafab685151","observation_id":"8bf93735-835e-413d-9cbc-2c78b0cbc75d","resolution":{"observed_at":"2026-08-03T22:48:12.563763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-03T22:48:12.670792Z","title":"Tabish Rashid, Mikayel Samvelyan, Christian De Witt, Gregory Farquhar, Jakob Foerster, and Shimon Whiteson","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.670792Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:bc28571d11a99d85f1a2a75474f44e1d01695023bffe986780a69dd18868d0d2","observation_id":"6536a929-c228-4cbf-8654-d7abe1360432","resolution":{"observed_at":"2026-08-03T22:48:12.670792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20417","last_updated":"2025-05-26T18:06:52Z","snapshot_observed_at":"2026-08-07T13:52:46.491642Z","submitted_at":"2025-05-26T18:06:52Z","title":"SCAR: Shapley Credit Assignment for More Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20417","snapshot_observed_at":"2026-08-03T22:48:12.321881Z","title":"Javier Castro, Daniel G´omez, and Juan Tejada","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T22:48:12.321881Z"},"links":{"cited_paper":"/paper/2505.20417","citing_paper":"/paper/2511.10687"},"observation_digest":"sha256:f26dfc56acf1cbe97861135bffa11d3b8a21846f7871c736942b65b3e6c76896","observation_id":"6fa6716e-04e7-41c2-a61f-c2dcbd4576e4","resolution":{"observed_at":"2026-08-03T22:48:12.321881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.10687","last_updated":"2026-07-01T23:47:17Z","latest_version":3,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-04T13:43:41.714396Z","submitted_at":"2025-11-11T22:21:08Z","title":"Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 0 inbound Pith citation observations for arXiv:2511.10687."}