{"as_of":"2026-08-08T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49d98039eb45bf24628e5364291339061bd09bdeb491720b8248bb5e16abd35d","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:29.581142Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:50:27.250841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:41:29.637290Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-03T20:52:51.049418Z","title":"Egovlm: Policy optimization for egocentric video understand- ing.arXiv preprint arXiv:2506.03097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18242","last_updated":"2026-06-30T03:26:30Z","snapshot_observed_at":"2026-08-07T23:32:07.863489Z","submitted_at":"2025-11-23T01:25:17Z","title":"EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:52:51.049418Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2511.18242"},"observation_digest":"sha256:168c017a5460d10b704292c6d17e74ff635114553897c0fb8d374de4718d52d4","observation_id":"358e3010-f86b-4f49-a0c8-0dcd3bb9fe7c","resolution":{"observed_at":"2026-08-03T20:52:51.049418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-04T05:50:27.250841Z","title":"arXiv preprint arXiv:2506.03097 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12147","last_updated":"2026-08-03T09:43:55Z","snapshot_observed_at":"2026-08-06T23:30:44.941267Z","submitted_at":"2026-03-12T16:46:01Z","title":"EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T05:50:27.250841Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2603.12147"},"observation_digest":"sha256:243fa30483b776175edb90e913b2b4961a498807f9eb93499bbb5b2dcc73a8b8","observation_id":"db8a76be-cd62-4481-9ca2-4f1014065a3b","resolution":{"observed_at":"2026-08-04T05:50:27.250841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems30","venue":null,"work_id":"5fe9ebd5-087d-4888-8d04-569bc746d011","year":2017},"citing_paper":{"arxiv_id":"2604.27621","last_updated":"2026-04-30T09:11:25Z","snapshot_observed_at":"2026-08-03T01:43:27.294399Z","submitted_at":"2026-04-30T09:11:25Z","title":"Robot Learning from Human Videos: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T04:55:44.273643Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2604.27621"},"observation_digest":"sha256:d16dcd30c86d4c1a25f502a4b325443f74037d690093b7ef6f509eb733f15513","observation_id":"1fdb557d-46fb-422e-b3b0-ef98a0901133","resolution":{"observed_at":"2026-05-12T10:41:29.640044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems30","venue":null,"work_id":"5fe9ebd5-087d-4888-8d04-569bc746d011","year":2017},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-08T17:16:31.820718Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:e691f0696cc2186d2d6251ebeecd3739e82cfd589959b89cf59af35f900b9d9f","observation_id":"6dbe324b-7bf7-4845-adb5-069be76a7df9","resolution":{"observed_at":"2026-05-11T17:46:06.581439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-04T05:19:56.255880Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.04227","last_updated":"2026-08-01T20:12:35Z","snapshot_observed_at":"2026-08-06T23:24:38.697717Z","submitted_at":"2026-05-05T19:12:11Z","title":"Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T05:19:56.255880Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2605.04227"},"observation_digest":"sha256:28f044482219823a556abc9a0ff174fcfc28330acae6553fb38a244174ae347b","observation_id":"2ed5ebf4-0079-4353-a6bd-f0edb17c0757","resolution":{"observed_at":"2026-08-04T05:19:56.255880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03097/citation-record","integrity":"/paper/2506.03097/integrity","json":"/paper/2506.03097/citation-record.json","paper":"/paper/2506.03097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.837133Z","title":null,"venue":null,"work_id":"0a1bc643-5bae-46fa-a26f-065b010b0bf9","year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.484755Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:229b1cf02f1434f047ff94683f1f89c9360972d479e41a3984163cdcf5a2ee1d","observation_id":"9cf0adb5-e990-427e-b9ba-fcc2aabeae8c","resolution":{"observed_at":"2026-08-07T11:14:31.912954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:14:26.585399Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.585399Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:1ed46fce726ccda21f08b3e229bd30be44e216e9ae328992f4c277c20e94279f","observation_id":"7c62262a-f97b-4a42-a49e-e7c8c4d7f46d","resolution":{"observed_at":"2026-08-07T11:14:26.585399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T11:14:26.665985Z","title":"Back to basics: Revisiting reinforce style op- timization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.665985Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:de69fd7c72ac6d88d2f7afc2a2bd54ca7933242abb3f2474d107d51d5d453cd9","observation_id":"268c3634-4b6b-4f1d-8dc7-fdbe3453239c","resolution":{"observed_at":"2026-08-07T11:14:26.665985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:26.747337Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.747337Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:53148cfb8b44656faaf1658ac478246573dafa3f112ab4100961c9ccaac8a8c1","observation_id":"6e54bb2d-fa9d-4c34-aa24-d369516496b3","resolution":{"observed_at":"2026-08-07T11:14:26.747337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-07T11:14:26.803299Z","title":"Egoplan- bench: Benchmarking multimodal large language models for human-level planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.803299Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:5fa365f04a9246bb52594b97dc2a6a603747343f6daf420c5f1d597467ec51f6","observation_id":"829fa18c-862f-4e6b-8a1a-caaeada02d0f","resolution":{"observed_at":"2026-08-07T11:14:26.803299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11623","last_updated":"2024-10-15T14:08:53Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T14:08:53Z","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11623","snapshot_observed_at":"2026-08-07T11:14:26.902583Z","title":"Vide- gothink: Assessing egocentric video understanding capabili- ties for embodied ai.arXiv preprint arXiv:2410.11623, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.902583Z"},"links":{"cited_paper":"/paper/2410.11623","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:3402800d06fa736de7bc036052420ee94d34609829f06630d67572a30f337589","observation_id":"466cd78f-6508-472d-b095-c69c619c2e8e","resolution":{"observed_at":"2026-08-07T11:14:26.902583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.722427Z","title":null,"venue":null,"work_id":"38fb642b-aeb6-4576-a5de-67bcf330c352","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:26.966208Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:bf0b1871894eeb68740a6a9b5a797acd83211655c186b5375d3b8ceff54ec600","observation_id":"6531419f-4afd-4eed-8a25-94de004f008c","resolution":{"observed_at":"2026-08-07T11:14:31.779038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T11:14:27.043868Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.043868Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:8d3c1a614f0a02f37671ec8cee6261152207edb606546896eb14047e81da6557","observation_id":"7281fecc-e61b-40e9-aba9-dc314e630fbf","resolution":{"observed_at":"2026-08-07T11:14:27.043868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:14:27.136926Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.136926Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:845064205811890910f3a628086d31fc0beb03242be020f23693eccebc1b2467","observation_id":"fd5018df-37a8-459b-bd86-54df58edf779","resolution":{"observed_at":"2026-08-07T11:14:27.136926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.599923Z","title":"Mvbench: A comprehensive multi- modal video understanding benchmark, 2024","venue":null,"work_id":"9713188c-018f-4127-8ed5-5490e76a9e14","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.251656Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:9694da100b29ca2391a002bd5568087afd5621e6b14b18718b1f61314d3b0a58","observation_id":"8e1f2ebc-5652-4ef5-9a09-f499df2d6a3d","resolution":{"observed_at":"2026-08-07T11:14:31.650068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07856","last_updated":"2026-07-09T13:57:40Z","snapshot_observed_at":"2026-08-07T16:06:48.703650Z","submitted_at":"2025-04-10T15:32:00Z","title":"Dual-Difficulty Curriculum Learning for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07856","snapshot_observed_at":"2026-08-07T11:14:27.351094Z","title":"2d-curri-dpo: Two- dimensional curriculum learning for direct preference opti- mization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.351094Z"},"links":{"cited_paper":"/paper/2504.07856","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:4ffe6ecffd7de169ec5043748fb6868befd35130f5567de1bce0d58ed7f5012c","observation_id":"9d089f33-2fa1-42a4-b067-705125e34387","resolution":{"observed_at":"2026-08-07T11:14:27.351094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.483415Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":"de2f5ce9-c23b-4938-a329-a4c36d599630","year":2004},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.482076Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:56d4f3a2df82ff534035b2a648579d98ef2277e906dcc40ae567b15551f06e23","observation_id":"94afe2fa-f34c-4ffc-9b8f-dce191566858","resolution":{"observed_at":"2026-08-07T11:14:31.558170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:27.604637Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.604637Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:0357a11ab4b38aa6c09731f948b6241f837c41dc296d577f5f4d2fe3df23a431","observation_id":"3094ddd2-5790-45dc-8488-ba0939c6f1c1","resolution":{"observed_at":"2026-08-07T11:14:27.604637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:14:27.701631Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.701631Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:99a21b668f85a6e7a546a5b9bd152525bd41ab025fb70ee73b0b2fc7daaaf0f0","observation_id":"1f733e8e-e71c-4a73-b8e3-a4d59c859591","resolution":{"observed_at":"2026-08-07T11:14:27.701631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T11:14:27.794624Z","title":"Visual- rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.794624Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:f1fa54934fbc8bbe2729daccff9cbc34b8a3282ef852cf75737f6fec0cb7a6ed","observation_id":"52c4be18-2d30-49e9-ba1d-c1880b371685","resolution":{"observed_at":"2026-08-07T11:14:27.794624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.370116Z","title":"Reasoning models can be effective without thinking, 2025","venue":null,"work_id":"2b73119f-c7cb-4e5b-827f-e44fdffebb80","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.897137Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:5d29af64ba309344f04923001819eba09c834892c883be533dceb6261ddf795c","observation_id":"32e78173-37f0-4384-9aa4-b0f083b520eb","resolution":{"observed_at":"2026-08-07T11:14:31.418970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.250030Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"7dda0793-29ed-430b-8bcc-b86bc0e75f5e","year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:27.989782Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:fcc7359a85252e7627cde0f68054f7531926c9d9725b80bc6aedff6dd2ef789b","observation_id":"a91b1c91-5fe9-4fc6-8fb2-4495f31efc8e","resolution":{"observed_at":"2026-08-07T11:14:31.299087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.107807Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.107807Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:9c920f2134ee6ed47897c2a94e73f79c57146efca3896c59cb70db4c32043f49","observation_id":"dd2855f9-5bca-45ea-969e-eb567c9996a8","resolution":{"observed_at":"2026-08-07T11:14:28.107807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:31.093454Z","title":"Medvlm-r1: Incentivizing medical reasoning ca- pability of vision-language models (vlms) via reinforcement learning, 2025","venue":null,"work_id":"9d52e8a1-24b8-4ad3-ad9e-78cd406596b2","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.186843Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:ffd05c263ec10e9a95478ecb3faaeffc0c490f0975e464aba1e73239e1c09257","observation_id":"08c17e3c-3a5d-403c-b440-72646bd5320c","resolution":{"observed_at":"2026-08-07T11:14:31.178831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.981304Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"7bb36903-eec5-4fca-8288-4b4cf196ff93","year":2021},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.261259Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:2d400171acff70dc65d52831dfc4d346bae7e296146ecf0084cc565f42b68c79","observation_id":"298fb0c7-5478-40fc-ad63-b781ba56dcf8","resolution":{"observed_at":"2026-08-07T11:14:31.041234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.361137Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.361137Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:e021d29856b0643062c9e1fe3a8571b1034c293e31017ab46c68648a5276addd","observation_id":"7742fe99-1aa1-48bf-9fde-6792242a6b3b","resolution":{"observed_at":"2026-08-07T11:14:28.361137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:14:28.448038Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.448038Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:94011e708f44312f481ef2620403eddc523d8a15c66056a5576e06c2e661f854","observation_id":"f9c58009-197e-4dfe-8e46-e8a0dc3e55c6","resolution":{"observed_at":"2026-08-07T11:14:28.448038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:14:28.572354Z","title":"Deepseekmath: Pushing the limits of mathe- matical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.572354Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:24c86f0bcabc8f052c24257a15230db0fffe9e86d2749d882768727320c80bd7","observation_id":"e43a7e88-60ed-4972-a6b7-ff2fe5ebbd17","resolution":{"observed_at":"2026-08-07T11:14:28.572354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.821742Z","title":null,"venue":null,"work_id":"5b7577eb-21b8-43a7-9d83-b76df9157012","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.653266Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:309499ebae0997780fc8e1cac8c9c009e2159097f1f21ff61dd90e9d2de755dd","observation_id":"42623fe7-8624-4ba8-aad3-ed55fcf989cf","resolution":{"observed_at":"2026-08-07T11:14:30.870663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T11:14:28.744187Z","title":"Vlm- r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.744187Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:b386f269545bab58fef432d9d88357051913a93895478fb1d7b7eff97a467d95","observation_id":"071969d7-a674-4a0c-ae25-d3cf448472a5","resolution":{"observed_at":"2026-08-07T11:14:28.744187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:14:28.861844Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.861844Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:a1ebfed1380aeb25c0a4ae0d5a4a14b31263fe33fa0326206b85421a0557d000","observation_id":"3badcadc-13ad-476b-9356-b973be507cc3","resolution":{"observed_at":"2026-08-07T11:14:28.861844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:28.924627Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:28.924627Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:e4168f513fe23c7c19d978ade66a7419505b126c7c5bb68f12099557083bca75","observation_id":"e7ae7185-273b-42c0-a295-50a794bcd589","resolution":{"observed_at":"2026-08-07T11:14:28.924627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.643424Z","title":"Wizardlm 2, 2024","venue":null,"work_id":"d4adec6b-73fa-465b-b13a-7807b0f1f385","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.032858Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:aa5fd610b9a4cfbb8f39e4a9da551d437d4e789587646be385b7bcc2b46b8d08","observation_id":"350801aa-6cc5-4d4c-a2e3-37346c54cf80","resolution":{"observed_at":"2026-08-07T11:14:30.711275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-08-07T11:14:29.112728Z","title":"St-think: How multimodal large language mod- els reason about 4d worlds from ego-centric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.112728Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:90db30d866cc9b7f9da81027a9636d568e90d908034af87339909e3541252cef","observation_id":"7825ea91-ba7e-42fb-a506-0c2806d66248","resolution":{"observed_at":"2026-08-07T11:14:29.112728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.497497Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"fb5a209f-1412-4db2-8635-a750c618ef3d","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.229419Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:de2c73b277f8f965e723f8ea99438df75eb72d0f2b31866cf7dfb8737e1a66eb","observation_id":"819dae82-f2af-4964-b142-c92a2946656e","resolution":{"observed_at":"2026-08-07T11:14:30.571100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.399225Z","title":"Mm-ego: Towards build- ing egocentric multimodal llms","venue":null,"work_id":"1f372fed-f28b-46b8-a0cc-532e21c84879","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.289694Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:c306f21948af7ed22016920f85648c764f09541a357a5c74b2c0f0d6c3768ba6","observation_id":"f48211bc-4251-41c3-bd38-c7686456d4e3","resolution":{"observed_at":"2026-08-07T11:14:30.450637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.397148Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.397148Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:da6193eba418619f20dc9038692e3431a2f7c0ab1ef49d222508fbafe288c82d","observation_id":"2a23480f-3d85-4f22-964e-c9c8e56192d7","resolution":{"observed_at":"2026-08-07T11:14:29.397148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.244506Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"f44e5411-7fe6-40d2-82be-ecb5c5b60c20","year":2024},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.444276Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:f8918b76cb6384471cf3b93466e510d5a759d5727534d8bbce5ebc88a35387b3","observation_id":"6781ea2e-d1f7-4430-a462-1821dc6db063","resolution":{"observed_at":"2026-08-07T11:14:30.310972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:30.097182Z","title":"R1-zero’s ”aha moment” in visual reasoning on a 2b non-sft model, 2025","venue":null,"work_id":"6b6d3af0-cbd3-46da-b4fb-4fc00c84c3d1","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.544152Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:733c56ca6ad91121b0bff845d1d7bba74c36e672d120b8b2dd66c85bb1c8b8f7","observation_id":"c3d95f10-d7c8-4aaa-b7c9-c88f519f0f44","resolution":{"observed_at":"2026-08-07T11:14:30.161229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:29.921169Z","title":"Egotextvqa: Towards egocentric scene-text aware video question answering, 2025","venue":null,"work_id":"70cc27ab-a0f2-46fa-a378-1a187cdbfd16","year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.581142Z"},"links":{"citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:52850382e81856cbc62dfd421c4bd8bd45a58a03e9f200b87dfbf6cd9d037435","observation_id":"da53d852-81dc-4541-ae7c-4a469c6a3fa0","resolution":{"observed_at":"2026-08-07T11:14:30.027639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:06:31.009082Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 5 inbound Pith citation observations for arXiv:2506.03097."}