{"as_of":"2026-08-10T03:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc696557839021e93ea774f53ca5c65ed254cd64ee1d7c07f726437fb90a6f5d","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:44:39.682811Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19567/citation-record","integrity":"/paper/2508.19567/integrity","json":"/paper/2508.19567/citation-record.json","paper":"/paper/2508.19567"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.17813","last_updated":"2025-07-24T15:10:45Z","snapshot_observed_at":"2026-08-09T05:46:31.598913Z","submitted_at":"2024-06-24T23:41:46Z","title":"Unsupervised Concept Drift Detection from Deep Learning Representations in Real-time","version":2},"cited_work":{"arxiv_id":"2406.17813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17813","snapshot_observed_at":"2026-08-05T15:44:40.781356Z","title":"Unsupervised Concept Drift Detection from Deep Learning Representations in Real-time","venue":"cs.LG","work_id":"843f36fe-a48f-457f-9406-5ea0f3c06739","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.297770Z"},"links":{"cited_paper":"/paper/2406.17813","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:0fd4242db41aedb105a5a257f52aa43ac0cb39cc16964bc10585568373a882eb","observation_id":"1cf30fcf-e54a-45fa-9ab9-c9fea9ad904a","resolution":{"observed_at":"2026-08-05T15:44:40.886960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11309","last_updated":"2023-06-15T00:12:54Z","snapshot_observed_at":"2026-08-09T06:04:13.093344Z","submitted_at":"2023-03-20T17:47:31Z","title":"Bubbling of K\\\"ahler-Einstein metrics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11309","snapshot_observed_at":"2026-08-05T15:44:38.462427Z","title":"A., Benajiba, Y., Ballesteros, M.: Dynamic Benchmarking of Masked Language Models on Temporal Concept Drift with Multiple Views","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.462427Z"},"links":{"cited_paper":"/paper/2303.11309","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:892cca30bec4d944321c41f9336d2c38d083fbc5a9c2dc9244b59e8c57a1a3f7","observation_id":"0054fdc0-6a7b-4d2a-954e-9f7e225cbcba","resolution":{"observed_at":"2026-08-05T15:44:38.462427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09160","last_updated":"2024-12-12T10:46:14Z","snapshot_observed_at":"2026-08-08T02:49:40.522560Z","submitted_at":"2024-12-12T10:46:14Z","title":"Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation","version":1},"cited_work":{"arxiv_id":"2412.09160","doi":"10.48550/arxiv.2412.09160","metadata_source":"pith","pith_arxiv_id":"2412.09160","snapshot_observed_at":"2026-08-05T18:16:11.560912Z","title":"Pinpoint Counterfactuals: Reducing social bias in foundation models via localized counterfactual generation","venue":"cs.CV","work_id":"2f3fb410-1c96-4e02-a39a-933a3acd6ddd","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.520437Z"},"links":{"cited_paper":"/paper/2412.09160","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:c02c830e20afe8adc6cb8865fc83af78ff52dfa8115cd456c9eeef10ca7ab903","observation_id":"6687d88d-2e56-49f3-ac17-78c763673605","resolution":{"observed_at":"2026-08-05T15:44:40.151591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16455","last_updated":"2025-08-25T01:01:38Z","snapshot_observed_at":"2026-08-09T15:50:26.906021Z","submitted_at":"2024-05-26T07:00:05Z","title":"On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16455","snapshot_observed_at":"2026-08-05T15:44:38.622610Z","title":"J.: On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.622610Z"},"links":{"cited_paper":"/paper/2405.16455","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:b024a6e6c55ecc348ff54a6fccf12ca3b9ae7da302f08a1cd29f8f9e8fd8d341","observation_id":"7c1c29ba-f599-4abb-8e1f-7192e8ac808e","resolution":{"observed_at":"2026-08-05T15:44:38.622610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:41.231819Z","title":"ACL Long Paper (2025)","venue":null,"work_id":"d8def3af-a9e2-4d73-a6f1-44d48e71dc72","year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.744210Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:c0db2315867c3f36ea5735e428eece192f26da464eddfe134ea692742083af54","observation_id":"93716715-9978-42be-a103-bf34678de6da","resolution":{"observed_at":"2026-08-05T15:44:41.374021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14758","last_updated":"2024-11-07T15:40:25Z","snapshot_observed_at":"2026-07-06T18:18:47.640933Z","submitted_at":"2024-05-23T16:29:29Z","title":"Axioms for AI Alignment from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14758","snapshot_observed_at":"2026-08-05T15:44:38.879132Z","title":"arXiv preprint (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.879132Z"},"links":{"cited_paper":"/paper/2405.14758","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:d42674b0f80c5ff7312393d4e33527dd9c867fcbeed747489cc4fcdcc5ff99ea","observation_id":"7c5af0fe-90f3-4854-93b8-aefbc3283826","resolution":{"observed_at":"2026-08-05T15:44:38.879132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T15:44:38.975171Z","title":"arXiv preprint (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.975171Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:0a7cfb09fd644380e095db8d09e1ba881c5a35045454f0ae0a1a8d5106e9ada9","observation_id":"4b4df1d4-e9d8-435f-ae1b-2cbf8d1d07bf","resolution":{"observed_at":"2026-08-05T15:44:38.975171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-05T15:44:39.099633Z","title":"arXiv preprint (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.099633Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:5344ca0fbc13f9cbe2e644ffe0e2eb3c19abcbb3cb449b29a771cddff43b5239","observation_id":"923a96db-b7f5-4e3f-8c12-29fc44fb86ba","resolution":{"observed_at":"2026-08-05T15:44:39.099633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2024/250","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:39.793126Z","title":"IJCAI (2024)","venue":null,"work_id":"e95de6e2-a3e2-4073-967b-02186e095128","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.196330Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:c221ddf58dafd5c7b57ce3bcb1c49e6b385650c4bede0458e562b61cdf00ec4f","observation_id":"79ff5b0a-2487-4a5b-988f-5aaa386772ad","resolution":{"observed_at":"2026-08-05T15:44:39.890905Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9764.36931","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:40.563993Z","title":"F AccT (2024)","venue":null,"work_id":"455e0db4-9bcb-4f84-b70e-48798dffa42c","year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.300014Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:7b8518d9d20cab9d2ff35b6ac34ae1f6202b3f76f7b438c34258956b1f299d19","observation_id":"a68d5bed-fb1d-4a56-9f91-be3f92577fb8","resolution":{"observed_at":"2026-08-05T15:44:40.665521Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:39.360105Z","title":"NeurIPS Workshops (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.360105Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:1e571884003115794a2d338bd97adbd11695e52e1624b04a7954adc8ce96b79c","observation_id":"a4af2564-5cdd-4f01-a626-dd9f741fb5ef","resolution":{"observed_at":"2026-08-05T15:44:39.360105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07085","last_updated":"2025-08-09T19:39:33Z","snapshot_observed_at":"2026-08-06T20:39:37.438272Z","submitted_at":"2025-08-09T19:39:33Z","title":"Improving Real-Time Concept Drift Detection using a Hybrid Transformer-Autoencoder Framework","version":1},"cited_work":{"arxiv_id":"2508.07085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07085","snapshot_observed_at":"2026-08-05T15:44:40.289426Z","title":"Improving Real-Time Concept Drift Detection using a Hybrid Transformer-Autoencoder Framework","venue":"cs.LG","work_id":"efe1d55f-d52d-4707-9527-1b94c519ce05","year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.466931Z"},"links":{"cited_paper":"/paper/2508.07085","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:5a6303150f7260235e12e682df5536aef4fa8cffb7c39f4f41e8466157354bf8","observation_id":"3d59fb5e-1a28-4c03-9309-037afe1233a1","resolution":{"observed_at":"2026-08-05T15:44:40.354785Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:44:41.013562Z","title":"arXiv preprint (2023)","venue":null,"work_id":"ff904298-d990-4d6c-9c6e-48c28448900e","year":2023},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.567689Z"},"links":{"citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:f6208bc035b400ef694b74e8ac0fb7ec64eccbc61f91f0c18f046127a1adb6ee","observation_id":"f32b68ef-3f2b-4d9b-89dd-26e0656748e7","resolution":{"observed_at":"2026-08-05T15:44:41.127320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12345","last_updated":"2025-01-21T18:23:42Z","snapshot_observed_at":"2026-08-09T04:50:47.361235Z","submitted_at":"2025-01-21T18:23:42Z","title":"The doubly librating Plutinos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12345","snapshot_observed_at":"2026-08-05T15:44:39.682811Z","title":"arXiv preprint (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:39.682811Z"},"links":{"cited_paper":"/paper/2501.12345","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:d5425243ece0a872a88a641d484cd54d68e7ccb1e911999237383f91dff31c75","observation_id":"e1b5eae3-ff19-4adf-a37f-730502636d27","resolution":{"observed_at":"2026-08-05T15:44:39.682811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:55:48.990961Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2508.19567."}