{"as_of":"2026-08-09T00:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c205b33cd492c845d5fa19b2b5a5ca44d882791fa32b48d89688f7e1dea33413","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:46.312250Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:35:33.360009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:07:12.870465Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"cited_work":{"arxiv_id":"2506.05904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05904","snapshot_observed_at":"2026-07-02T17:07:12.870465Z","title":"person wearing [clothing description]","venue":null,"work_id":"cf176532-0efd-44ab-8327-d512bb5d992c","year":2025},"citing_paper":{"arxiv_id":"2512.01707","last_updated":"2026-05-13T04:12:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-01T14:15:44Z","title":"StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T02:49:12.987772Z"},"links":{"cited_paper":"/paper/2506.05904","citing_paper":"/paper/2512.01707"},"observation_digest":"sha256:7139fb24d00a4793813cd33df36bdd4005b517229c3b8d9e30b63f885c71bc9e","observation_id":"479f8fc6-af92-475f-9443-3c600a42c8b6","resolution":{"observed_at":"2026-05-17T02:51:28.084265Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"cited_work":{"arxiv_id":"2506.05904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05904","snapshot_observed_at":"2026-07-02T17:07:12.870465Z","title":"person wearing [clothing description]","venue":null,"work_id":"cf176532-0efd-44ab-8327-d512bb5d992c","year":2025},"citing_paper":{"arxiv_id":"2606.06991","last_updated":"2026-06-05T07:29:20Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T07:29:20Z","title":"Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T22:11:01.690237Z"},"links":{"cited_paper":"/paper/2506.05904","citing_paper":"/paper/2606.06991"},"observation_digest":"sha256:236b6826c6cec5fabcb65efda3cd2aff292188fe7d07962a768cfb7ec6bcedfb","observation_id":"2f57766a-d5a3-48f5-a834-5e95d888ffed","resolution":{"observed_at":"2026-07-02T17:07:12.871955Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"cited_work":{"arxiv_id":"2506.05904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05904","snapshot_observed_at":"2026-07-02T17:07:12.870465Z","title":"person wearing [clothing description]","venue":null,"work_id":"cf176532-0efd-44ab-8327-d512bb5d992c","year":2025},"citing_paper":{"arxiv_id":"2606.31980","last_updated":"2026-06-30T17:18:47Z","snapshot_observed_at":"2026-08-07T03:39:48.554505Z","submitted_at":"2026-06-30T17:18:47Z","title":"DigitalCoach: Communication and Grounding Gaps in Human and Agentic Computer Use Coaching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:33.360009Z"},"links":{"cited_paper":"/paper/2506.05904","citing_paper":"/paper/2606.31980"},"observation_digest":"sha256:b4f1984dbbd74a6fac8abb2040931a0a3d12703d123931e34a8e1acabb2dc490","observation_id":"e3ffd5b0-20ec-43c2-9f6e-218ef6916fa0","resolution":{"observed_at":"2026-07-01T10:25:41.177276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05904/citation-record","integrity":"/paper/2506.05904/integrity","json":"/paper/2506.05904/citation-record.json","paper":"/paper/2506.05904"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.468427Z","title":null,"venue":null,"work_id":"c4816486-9e2e-4e01-8c8f-d12d90e41388","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.999537Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:4aa58d25cc082cb3798b556bae19580c87acec87b71bf0bd810353c10def63a0","observation_id":"3e0c67e7-ba3c-4754-8fb3-ea49b596eb85","resolution":{"observed_at":"2026-08-07T10:17:46.470356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:17:44.040534Z","title":"In Proceedings of the 2023 Conference on Empiri- cal Methods in Natural Language Processing, pages 10462–10479","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.040534Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:d83011170f33156b2fd56c2cfd2e4981deb3a372993350db6f8ac593484516ec","observation_id":"3f837d44-eabf-4ebd-b8c0-9ed41b93dcd8","resolution":{"observed_at":"2026-08-07T10:17:44.040534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.443804Z","title":"Make them more clear and helpful when necessary, but keep them concise and to the point in general","venue":null,"work_id":"17c57ee8-2fad-47eb-afde-c02e5e3364da","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.377844Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:529a44efdaace8aac1d8fdf3fc9841140c7c7ecc69158579278ad6e30f70ee67","observation_id":"20df1673-8786-4d11-b2db-b8ab5a63f275","resolution":{"observed_at":"2026-08-07T10:17:46.446288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.437688Z","title":"make sure","venue":null,"work_id":"3c6d697e-5950-4eab-8f77-52d83db25dcc","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.528253Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:f4891dd7e1ab6030c0dbcdeec19cdb95261b12321cb9102ffb647557d25369ae","observation_id":"c5f5d63a-a825-4570-ae4a-7e8afe2fd463","resolution":{"observed_at":"2026-08-07T10:17:46.439987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.431348Z","title":"as I have mentioned this earlier","venue":null,"work_id":"feb16413-08c5-472e-bd14-37248cdcd909","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.666276Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:f1568164d2b1e399e05c6248a2c33317ffc3d759a247fdac56dffb8e7a433b6d","observation_id":"b5e2f5d4-b574-4325-8059-c8985d415b01","resolution":{"observed_at":"2026-08-07T10:17:46.433616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.425189Z","title":"Do not just copy paste the original dialog! Listing 7: Prompt for dialogue refinement and intent labeling for assistant turns","venue":null,"work_id":"e6332f56-fbd4-42d8-a7a6-8464c4c6c278","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.788553Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:cf4e9dd4b2ba6e1858c7750ec91af9f8909bc07ec876be5aed088d12fdc08f20","observation_id":"22224aa8-18e7-4791-9887-4da61dbfc685","resolution":{"observed_at":"2026-08-07T10:17:46.427486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.486894Z","title":"In Euro- pean Conference on Computer Vision , pages 485–","venue":null,"work_id":"059e9de3-7569-480a-b7d7-d1aebe17a334","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.574307Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:2d2718c6a039f8550d8b368b68d09fc72319b653b71adc2436ddf78326a6c6e5","observation_id":"533d359d-717d-4c51-8d1f-796f4ba0351d","resolution":{"observed_at":"2026-08-07T10:17:46.489256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.480535Z","title":"Okay.\" - [15.1s] assistant:","venue":null,"work_id":"99d78565-7c72-4f48-9e3f-dfada06a3416","year":2020},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.841758Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:a1339d6959928a1f475cf9ab4797c751fece769422fb5eab8fff226582096b05","observation_id":"2690e6dd-5de3-4497-ac29-d80834516bee","resolution":{"observed_at":"2026-08-07T10:17:46.482942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.474142Z","title":"Here is a video description of an experienced user working on the task - {goal_description}: {video_descriptions} Try to infer the **high-level** recipe from the descriptions","venue":null,"work_id":"d6771c82-2c15-4455-a80b-4d303b2b7a77","year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.954448Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:2e7486044a1d8ee1abde23a28980056e6dc65afb57634eb324fa87689641b524","observation_id":"eec085a6-76cb-4564-a2d8-15af620d1c51","resolution":{"observed_at":"2026-08-07T10:17:46.476813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.462173Z","title":"Final answer: 1, 2 or 0","venue":null,"work_id":"89dc80f8-6564-4e9a-9e77-930ff810a124","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.105117Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:15f0abb0fb99cbb8f9eafd6e303561c2336276f1a11fe395675d219bbdc727e6","observation_id":"67c2ae71-9413-43a6-9abb-6d3309aafcf7","resolution":{"observed_at":"2026-08-07T10:17:46.464544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.456495Z","title":null,"venue":null,"work_id":"82714267-57f7-4c8a-81f3-4e47cad16eeb","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.192878Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:487134edc70e6568865201df9ea02ca88ebd87b35a17cc99dfc36c0179f2401e","observation_id":"4f23cfac-d128-44de-8e8c-7b8410870cfe","resolution":{"observed_at":"2026-08-07T10:17:46.458514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.450064Z","title":null,"venue":null,"work_id":"e8cabffb-aa91-4f6f-9174-ebaf36956935","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.259043Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:2de8662f8a30c280015ba3ea556d0c1e76422dd7bc6b04c9ba4e1f905e028022","observation_id":"7cd0bcf5-cbaf-46c7-b01a-f88073324140","resolution":{"observed_at":"2026-08-07T10:17:46.452416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.418620Z","title":null,"venue":null,"work_id":"29462562-af73-4107-929c-4473adf4a6a7","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.866815Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:ab654a359fb11210e3f183678fa14ff2ea39a011f90810df8381355004425ddc","observation_id":"9b42ba5a-bd29-45d9-b96a-3053554778bb","resolution":{"observed_at":"2026-08-07T10:17:46.421018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.412110Z","title":null,"venue":null,"work_id":"9f64ed32-ce53-4e4b-8052-2e7abcb99879","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:45.995430Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:c5f319eb18fe4e1fb4e781b0144b4e5aac66d39321ae77a821a737e224623e3c","observation_id":"71871af8-57d8-4b26-9272-205247579bbf","resolution":{"observed_at":"2026-08-07T10:17:46.414231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.405504Z","title":"Be faithful and try to include all the relevant information","venue":null,"work_id":"0ac7504b-dba3-4fb0-98bd-c6836a53f2e4","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.097964Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:d619e6bdd036f59eb435ba94257cdbb6416e92ea9edf938383a67c68736e0eee","observation_id":"15d96c16-d09c-4493-936e-4f681ee3b521","resolution":{"observed_at":"2026-08-07T10:17:46.407992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.398124Z","title":"The model is hosted locally using vLLM (Kwon et al., 2023), running a FP8-quantized version5 on four H100 GPUs","venue":null,"work_id":"1a6b5d8d-9ca7-47de-8d8d-3cc5bfaba7f3","year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.188528Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:01de65c5b6ef60d69d8af2b29719c8db81b615c925e337fc3420e09eb2b1e39d","observation_id":"c87130d2-8911-430a-9107-f17f3bb984c6","resolution":{"observed_at":"2026-08-07T10:17:46.400559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.390964Z","title":"Keep you analysis concise and to the point","venue":null,"work_id":"30c8157f-67d0-4da8-8eb6-a99c0e02e0d0","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.287871Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:3c4efaa14d5326f83269cf3158b766eaad17f4dabac28f2221dee6c61c7bf907","observation_id":"99eedae1-1ce4-40da-a045-97baffe4dceb","resolution":{"observed_at":"2026-08-07T10:17:46.393722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.384558Z","title":null,"venue":null,"work_id":"5a83ff28-ab0e-456a-800d-4dc3e6de5e8b","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.307519Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:42174ba4b766cf4ac0364881b855ce3a68e5160e1f1847d0b3965556b6991ede","observation_id":"985b43cd-4ed8-4ceb-b7df-8893d5f61057","resolution":{"observed_at":"2026-08-07T10:17:46.386835Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.376736Z","title":"C Model Implementation Details C.1 VideoLLM-Online Model Implementation We use LLaMA-3.1-8B-Instruct (Dubey et al.,","venue":null,"work_id":"cf5b69bb-0dc8-430a-ae7b-85408172c78a","year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.309943Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:3562e7eb7436ca4da8791f95c33b42168331850314e9121b26019e27473b0e35","observation_id":"7652d825-93f8-4351-ab45-8af382dfb62c","resolution":{"observed_at":"2026-08-07T10:17:46.379684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.369769Z","title":"Assis- tant: C opens the fridge","venue":null,"work_id":"e9f8a98d-96a2-4ffd-bead-3b987a3976bf","year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.312250Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:5d75521a45d7c72e7c5efaa4fab9f90aee3b8e11e8acf0579f1199a4e722e511","observation_id":"d9f7746e-827e-4267-8da0-0e84f02f66eb","resolution":{"observed_at":"2026-08-07T10:17:46.372258Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T10:17:44.720073Z","title":"Te-Lin Wu, Satwik Kottur, Andrea Madotto, Mahmoud Azab, Pedro Rodriguez, Babak Damavandi, Nanyun Peng, and Seungwhan Moon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":501,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.720073Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:c57f69cf6b2d5b65eefecbfdf64b4f5687bad1f2ad080b74297baa9e3b4791fa","observation_id":"6d4782aa-01c2-45ca-ae44-13cd9f3a8ec4","resolution":{"observed_at":"2026-08-07T10:17:44.720073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.493503Z","title":"Advanced Engi- neering Informatics, 30(3):406–421","venue":null,"work_id":"9ff09a41-607f-48f6-bb9c-81c0eb3eac45","year":2024},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.514788Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:24c105fe99030d20e1a900acb9852e44fa5a260b8cd9c22bfdddfed701707e4f","observation_id":"1b285b52-eebf-47cc-87f9-ae8305faa457","resolution":{"observed_at":"2026-08-07T10:17:46.496567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.04871","last_updated":"2018-01-15T16:45:56Z","snapshot_observed_at":"2026-08-08T03:33:28.775960Z","submitted_at":"2018-01-15T16:45:56Z","title":"Building a Conversational Agent Overnight with Dialogue Self-Play","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.04871","snapshot_observed_at":"2026-08-07T10:17:44.248611Z","title":"arXiv preprint arXiv:1801.04871","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.248611Z"},"links":{"cited_paper":"/paper/1801.04871","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:79561b589c88b4641591d55df1629218d18a9f17b8fed7c49643803f9e3747a6","observation_id":"8cf2c2b6-ec5b-4af7-a9e8-50e75d97b459","resolution":{"observed_at":"2026-08-07T10:17:44.248611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:17:46.500406Z","title":"In Proceedings of the 28th International Con- ference on Computational Linguistics, pages 1103– 1121","venue":null,"work_id":"9c49b916-8670-4439-beae-bf7ff0569c07","year":2024},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.125632Z"},"links":{"citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:5f4929b5febd57661865b9d884a71feb50a9c68a19f3f7fccb460388e944e4ba","observation_id":"73ea1fff-5b0a-485d-b8a1-24ebddd0f364","resolution":{"observed_at":"2026-08-07T10:17:46.502692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14556","last_updated":"2024-12-09T01:35:34Z","snapshot_observed_at":"2026-08-03T13:04:30.948484Z","submitted_at":"2023-12-22T09:29:45Z","title":"CaptainCook4D: A Dataset for Understanding Errors in Procedural Activities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14556","snapshot_observed_at":"2026-08-07T10:17:44.214361Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.214361Z"},"links":{"cited_paper":"/paper/2312.14556","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:2df03c395448067af3b8c35868e68155bd101ffccfbbc54f411b0dca23cd7931","observation_id":"a323198b-a578-4063-945d-4f9d213661a7","resolution":{"observed_at":"2026-08-07T10:17:44.214361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00738","last_updated":"2023-11-01T15:13:49Z","snapshot_observed_at":"2026-07-31T09:25:32.439958Z","submitted_at":"2023-11-01T15:13:49Z","title":"Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?","version":1},"cited_work":{"arxiv_id":"2311.00738","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00738","snapshot_observed_at":"2026-08-07T10:17:46.360606Z","title":"Can Foundation Models Watch, Talk and Guide You Step by Step to Make a Cake?","venue":"cs.AI","work_id":"402b0702-8b99-424b-ac99-9eeb0cc8d196","year":2023},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:43.998466Z"},"links":{"cited_paper":"/paper/2311.00738","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:72c0a9e2cc65fcdfab35585e3b44a34255c787f653fb9a4ec386375f376657af","observation_id":"0f8b2f0a-e96f-4a9c-8c70-71e8e71673f8","resolution":{"observed_at":"2026-08-07T10:17:46.364950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:17:44.373593Z","title":"arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:44.373593Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.05904"},"observation_digest":"sha256:a1536af4211361b6f91427a13d83a305f0489e50673292df22eae071e9379e67","observation_id":"a2142ca6-68bf-41d4-84fd-0ba9b2e84808","resolution":{"observed_at":"2026-08-07T10:17:44.373593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05904","last_updated":"2025-06-06T09:23:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T22:26:24.817470Z","submitted_at":"2025-06-06T09:23:29Z","title":"Proactive Assistant Dialogue Generation from Streaming Egocentric Videos"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 3 inbound Pith citation observations for arXiv:2506.05904."}