{"as_of":"2026-08-09T12:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:345580f3d810237957d35b9ff41359dc846bd1ef814277ea0360d2f4669b20da","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:21:20.974159Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:37.420740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:19:33.993409Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-08-07T05:52:37.420740Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11108","last_updated":"2025-06-08T01:58:17Z","snapshot_observed_at":"2026-08-07T05:42:53.932259Z","submitted_at":"2025-06-08T01:58:17Z","title":"History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:37.420740Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2506.11108"},"observation_digest":"sha256:cd9b4136e6242b6ab424892f0809fb4682a1ac7e23c98254e091acf1499599e9","observation_id":"4ea29d57-e741-4927-bbac-f4f04f0a78e3","resolution":{"observed_at":"2026-08-07T05:52:37.420740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":"2502.10482","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-07-04T04:19:33.993409Z","title":"A self-supervised reinforcement learning approach for fine-tuning large language models using cross-attention signals","venue":null,"work_id":"46b37fd5-7378-4b46-885d-f8c68533ed92","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":256,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:5264bcd9b4e51e6bd189b0ecb2992ccfd8679deb7c2e110a4535bad1413dc2b1","observation_id":"89a34d12-678f-48f5-b3dd-6b2fa0dbdad5","resolution":{"observed_at":"2026-05-18T00:02:24.643178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-08-03T03:04:43.825632Z","title":"A self-supervised reinforcement learning approach for fine-tuning large language models using cross-attention signals.arXiv preprint arXiv:2502.10482,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.825632Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:62a165a3adeb37a38386ad41e0211324b9db6c12e7fede12329763d98456964a","observation_id":"742f1105-7c47-4576-b0c5-e82d31d4c6d2","resolution":{"observed_at":"2026-08-03T03:04:43.825632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":"2502.10482","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-07-04T04:19:33.993409Z","title":"A self-supervised reinforcement learning approach for fine-tuning large language models using cross-attention signals","venue":null,"work_id":"46b37fd5-7378-4b46-885d-f8c68533ed92","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:701c878e89325ad97753ab492ff5c0a4d5b880864d89e2dd3287ba410f3fade8","observation_id":"9723710c-7b9f-495f-84c3-bd4a23e19024","resolution":{"observed_at":"2026-07-01T20:56:13.494301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"cited_work":{"arxiv_id":"2502.10482","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10482","snapshot_observed_at":"2026-07-04T04:19:33.993409Z","title":"A self-supervised reinforcement learning approach for fine-tuning large language models using cross-attention signals","venue":null,"work_id":"46b37fd5-7378-4b46-885d-f8c68533ed92","year":2025},"citing_paper":{"arxiv_id":"2606.20881","last_updated":"2026-06-18T19:15:50Z","snapshot_observed_at":"2026-08-07T07:30:08.874288Z","submitted_at":"2026-06-18T19:15:50Z","title":"When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T17:07:21.486960Z"},"links":{"cited_paper":"/paper/2502.10482","citing_paper":"/paper/2606.20881"},"observation_digest":"sha256:f0ac1dfe36257a3d0ded1fcf68120f9886bca3efcef937fcb62de767318c4b89","observation_id":"c1fe7b6d-0ea0-4f53-a2a8-6da86315c50a","resolution":{"observed_at":"2026-07-04T04:19:33.996029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10482/citation-record","integrity":"/paper/2502.10482/integrity","json":"/paper/2502.10482/citation-record.json","paper":"/paper/2502.10482"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T20:21:20.913663Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.913663Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:53549865c9791b446d77817af04043bc10c965a848b59446007450db76d32002","observation_id":"e3fafb5c-b76c-481f-a820-f06f2d865b78","resolution":{"observed_at":"2026-08-07T20:21:20.913663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:20.920048Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.920048Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:06ba3edb31936e2a5eee46e878ec6f7816745fbdf7105f2597098da24cebe489","observation_id":"23a940bf-6709-4e65-a53b-f87b608dc08f","resolution":{"observed_at":"2026-08-07T20:21:20.920048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:20.924816Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.924816Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:7a97b5afd7d98036d5616754f22763ffad11ba1aa96ca5a14e4f703847f5ba48","observation_id":"cd570a5a-b346-4148-9799-631a8b5dd40f","resolution":{"observed_at":"2026-08-07T20:21:20.924816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:21.174892Z","title":"Chatgpt: Optimizing language models for dialogue","venue":null,"work_id":"e6b5343c-d12d-441a-b85d-43127611b400","year":2022},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.929625Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:11009649cfee731651c3195756b26a3924c74757cb0ec04cee528ff951eba85d","observation_id":"b5d495fb-a15a-4528-b2c4-72926c213062","resolution":{"observed_at":"2026-08-07T20:21:21.181148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T20:21:20.934897Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.934897Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:0c4429950a930b3d006688b8b14963ab44de030ccc5b27f712461edd807bcc30","observation_id":"186287d1-4e2d-4e97-9dde-db2ae3999eb9","resolution":{"observed_at":"2026-08-07T20:21:20.934897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:21.154622Z","title":"Language models are unsupervised multitask learn- ers","venue":null,"work_id":"7a50a7b6-191c-42f2-b9a7-3b79c23200af","year":2019},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.939914Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:0b4db620b66fae737d52c058f9b99ca17a256d051444f5c927c1431349678520","observation_id":"19d814ff-2f57-4bdc-b3e7-45e508399abc","resolution":{"observed_at":"2026-08-07T20:21:21.162171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02700","last_updated":"2022-06-06T15:57:28Z","snapshot_observed_at":"2026-07-06T13:17:55.016298Z","submitted_at":"2022-06-06T15:57:28Z","title":"Forbidding Edges between Points in the Plane to Disconnect the Triangulation Flip Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02700","snapshot_observed_at":"2026-08-07T20:21:20.945097Z","title":"Self-critique: Fine-tuning language models to explain and critique their own generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.945097Z"},"links":{"cited_paper":"/paper/2206.02700","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:14c1f3a136511cf4e5686f37fa46bf690a3019a8b68e82d6a35b070cbf5c62a1","observation_id":"e0af5e2c-0263-4138-926c-49e28a95f4b1","resolution":{"observed_at":"2026-08-07T20:21:20.945097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T20:21:20.949944Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.949944Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:c0824242ac7e2b48d068ebff1611cdffd49909db1c755df3fd2ec7a00c8132bd","observation_id":"a509ea76-56ad-464f-8786-0278026219ea","resolution":{"observed_at":"2026-08-07T20:21:20.949944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:20.954926Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.954926Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:326bbef30df21470a7741dd35092012511a663c009cd796db279585224c7c4c8","observation_id":"c2cd1e53-ae47-4077-ba58-7ce3ddf7c156","resolution":{"observed_at":"2026-08-07T20:21:20.954926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:20.959735Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.959735Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:735d5105930f72752ef5d953062271f395a3040f40b01ba0dd2836ecfaeb6138","observation_id":"ad398887-fec1-48f2-a2eb-38d9420a57f4","resolution":{"observed_at":"2026-08-07T20:21:20.959735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:21:20.964290Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.964290Z"},"links":{"citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:b3bcc03c9008d94adc27b40fa083dc55fecb29c9401fabb26b8feffeb15a0a55","observation_id":"ffaf6ff3-7f47-4ed1-a8c6-423335e7a190","resolution":{"observed_at":"2026-08-07T20:21:20.964290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T20:21:20.969004Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.969004Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:ae600e914360cc5a0154902598d011b9518e6ab71c900c04c0196d5d0e0dafa1","observation_id":"d96af54b-3829-41ef-9387-7236d0200340","resolution":{"observed_at":"2026-08-07T20:21:20.969004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T20:21:20.974159Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, et al","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:20.974159Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.10482"},"observation_digest":"sha256:f929a10bc1aabe390ed8eaa9eceb991dd9014f55181c19ef5d31229b37896b68","observation_id":"7e05ab74-bddc-45b4-bfe4-ddeaaa387a5a","resolution":{"observed_at":"2026-08-07T20:21:20.974159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10482","last_updated":"2025-04-16T18:56:58Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T20:14:24.191429Z","submitted_at":"2025-02-14T01:44:04Z","title":"A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 5 inbound Pith citation observations for arXiv:2502.10482."}