{"as_of":"2026-08-24T02:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c07a8ab3825af367d862440b16990c39973ef0cc0a3944032d42a9a7c1cd5846","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:17:00.065856Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:55:44.834170Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T17:55:45.159103Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"cited_work":{"arxiv_id":"2505.01713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.01713","snapshot_observed_at":"2026-08-12T17:55:45.159103Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","venue":"cs.CV","work_id":"264ca93a-487a-40c9-8d04-e23d0f608755","year":2025},"citing_paper":{"arxiv_id":"2608.10765","last_updated":"2026-08-11T10:22:22Z","snapshot_observed_at":"2026-08-18T09:04:28.233652Z","submitted_at":"2026-08-11T10:22:22Z","title":"Compositional Benchmark Synthesis for Hierarchical Human Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:55:44.834170Z"},"links":{"cited_paper":"/paper/2505.01713","citing_paper":"/paper/2608.10765"},"observation_digest":"sha256:b483f7e6c3888884fbbd46b820a375d2b01a9b34f23577067b630fe52bce944b","observation_id":"c57a096f-e4b6-494f-b811-0b43be3e0627","resolution":{"observed_at":"2026-08-12T17:55:45.166090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.01713/citation-record","integrity":"/paper/2505.01713/integrity","json":"/paper/2505.01713/citation-record.json","paper":"/paper/2505.01713"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:16:59.916631Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.916631Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:6a060a070e4d661772010bb35f779b719259a5371a01c533c7f5266be6f17838","observation_id":"b23a21c9-dacb-4034-ad02-8fe9e7aa55fd","resolution":{"observed_at":"2026-08-16T04:16:59.916631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.485576Z","title":"The epic-kitchens dataset: Collection, challenges and baselines","venue":null,"work_id":"328f7d1f-4740-4e76-adca-b41ed6cbc1fa","year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.934262Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:d3a45cb9a0563206bfe4b1e1c01de41248b1c81aa88002a0e883154d5be6224c","observation_id":"45cdc215-036c-47dd-8de3-c187714b5a6e","resolution":{"observed_at":"2026-08-16T04:17:00.489441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.474912Z","title":"A technique for computer detection and correction of spelling errors","venue":null,"work_id":"c2259dcd-2777-4845-8b7f-9af5f11365ea","year":1964},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.937843Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:30b67e44a70dc9b00843708e0ee7401551fde46146a98fc161bd8ce4df02aad0","observation_id":"c903edfa-5d06-45ad-b073-80e193ab1f0a","resolution":{"observed_at":"2026-08-16T04:17:00.478671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.464643Z","title":"Rolling-unrolling lstms for action anticipation from first-person video","venue":null,"work_id":"3eb8ded4-9bd7-4642-984e-ba83c80574ab","year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.945334Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:2f3d20bead3706cce7ce7a8df2dee50c9c9f532610c7113bc752d368aa337fdd","observation_id":"bf4fbe5e-102b-4948-b6cf-40adccfb6ceb","resolution":{"observed_at":"2026-08-16T04:17:00.468213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.453524Z","title":"Future transformer for long-term action anticipation","venue":null,"work_id":"bdf87b53-f7be-4640-a1be-c473057ff60d","year":2022},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.948823Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:c671ac500e9a570a1d3f4596d46b79b2d97bca7267a6e53ebb4ca16ff5f19019","observation_id":"966d78ff-85f6-41c5-b0a4-f39ae2fa16f0","resolution":{"observed_at":"2026-08-16T04:17:00.457225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T04:16:59.955210Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.955210Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:a5bc6465f16184c4f2a401f8b093c3031c58dfc1a946ecf26b81068094370755","observation_id":"134fc880-21de-436e-a5c3-d78ba8ae891a","resolution":{"observed_at":"2026-08-16T04:16:59.955210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.421556Z","title":"Technical report for ego4d long term action anticipation challenge","venue":null,"work_id":"f545cad5-7061-495a-af06-13b31b90cfab","year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.966646Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:7e05f723413cc5b999513afcf6c1fb17fd0fa2cb8cc8e145f3465d77745d1591","observation_id":"f1b701bd-79f4-4c23-a6b0-d0bc66b07881","resolution":{"observed_at":"2026-08-16T04:17:00.425374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01467","last_updated":"2023-07-04T04:12:49Z","snapshot_observed_at":"2026-08-21T13:17:32.809869Z","submitted_at":"2023-07-04T04:12:49Z","title":"Technical Report for Ego4D Long Term Action Anticipation Challenge 2023","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01467","snapshot_observed_at":"2026-08-16T04:16:59.970868Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.970868Z"},"links":{"cited_paper":"/paper/2307.01467","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:03d11ba3422be1ecfea39e08d3e22a5c72f9da4e8e12d86198a2da101b032457","observation_id":"b838ab20-a63b-4e46-81f7-e4fa068c7359","resolution":{"observed_at":"2026-08-16T04:16:59.970868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.410862Z","title":"Anticipating the start of user interaction for service robot in the wild","venue":null,"work_id":"731be7d9-0b3f-4c3c-a781-af0f81bff986","year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.974858Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:3e1470ed1e74ac695d63b523726f59e8ae3771e1072cc5f369a0a9f96b210b30","observation_id":"346cb39d-1f4a-47f4-856e-9d8bfb4f1ee6","resolution":{"observed_at":"2026-08-16T04:17:00.414572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.399966Z","title":"Palm: Predicting actions through language models","venue":null,"work_id":"582802fe-bdf1-4155-b922-d4c953573276","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.978393Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:669f30d512e6c15e4bbe8a36ce2cb71acf99287dce4897ea8a6cca5b0ca53f3f","observation_id":"493db213-0aa1-4eb4-867e-9e081f79fb03","resolution":{"observed_at":"2026-08-16T04:17:00.403915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.389060Z","title":"Anticipating human activities using object affor- dances for reactive robotic response","venue":null,"work_id":"0608f25b-dba4-4ab1-aa3d-01b8487aa367","year":2015},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.981857Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:98bef9a42b2041c7516a83193f67fb8141340fcba3b700ff496bafb3a25ac365","observation_id":"c29b4694-c060-4178-a363-3202275621d1","resolution":{"observed_at":"2026-08-16T04:17:00.393245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.354294Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"f48ea62e-61a0-47e7-a8cf-0435ffc24f39","year":2025},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.992047Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:9a57e3b677667e4c84c747f84fdfda36bb8552e358fe7c30a7c25863d19dc307","observation_id":"e76c131d-b624-4bc3-9f5a-612d6ab8fbf1","resolution":{"observed_at":"2026-08-16T04:17:00.358287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.330850Z","title":"Can’t make an omelette without breaking some eggs: Plausible action anticipation using large video-language models","venue":null,"work_id":"fba22800-4ed3-49c9-b426-abc7f6ba26d7","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.998989Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:f43c942014bf092d025445dc46b40ae2c465251fef891e0f181c857425571e82","observation_id":"54a044e8-3d9d-46ed-9577-4eee2b2bc33d","resolution":{"observed_at":"2026-08-16T04:17:00.334653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.320083Z","title":"Ego-topo: Environment affordances from egocentric video","venue":null,"work_id":"14148093-50d7-49d8-9b67-3d0c9089b8d7","year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.002447Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:eb96d310a388e3dc0d1572cc1a46e368099ef67a2c8a36460b41d87d6c83faf6","observation_id":"ac04f3ad-eaf4-4502-96d5-190c0a1511db","resolution":{"observed_at":"2026-08-16T04:17:00.323854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.308622Z","title":"Rethinking learning approaches for long- term action anticipation","venue":null,"work_id":"2cb1dc2f-309d-4abe-a95e-006a6254c659","year":2022},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.006378Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:7d3d63e6f3e1a00335350d13185943aa9ba8fa4f81577bc96b5f0a87bcd898bd","observation_id":"4e59dfc2-f5c3-40e6-a55a-a4b39842175d","resolution":{"observed_at":"2026-08-16T04:17:00.312862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.297531Z","title":"Summarize the past to predict the future: Natural lan- guage descriptions of context boost multimodal object interaction anticipation","venue":null,"work_id":"8e95a998-b562-4a46-8f33-284c7f10dcd1","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.010065Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:641b0954e07291f54353b71eeb36c68ca35b075e93a18de7eb64dd44e80ee86a","observation_id":"2cc08456-6da6-47d8-82a4-11d7a56e6d06","resolution":{"observed_at":"2026-08-16T04:17:00.301486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18070","last_updated":"2024-07-01T02:44:11Z","snapshot_observed_at":"2026-08-21T13:17:27.400915Z","submitted_at":"2024-06-26T05:01:37Z","title":"EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18070","snapshot_observed_at":"2026-08-16T04:17:00.013657Z","title":"Egovideo: Exploring egocen- tric foundation model and downstream adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.013657Z"},"links":{"cited_paper":"/paper/2406.18070","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:3ffdbbc5154630476e30b2db03dd0c0a261c15016ba67032ff59ae74b7359e14","observation_id":"089ac1e6-e416-4e2d-ba63-2d0d867454b6","resolution":{"observed_at":"2026-08-16T04:17:00.013657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.018207Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.018207Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:cf7a96751fc7cbfbc98d1291452749ce076420814177572f4d817c34a4d9b21e","observation_id":"4702ef4c-8203-408b-9923-3c6b4558219d","resolution":{"observed_at":"2026-08-16T04:17:00.018207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.279200Z","title":"Pre- dicting the future from first person (egocentric) vision: A survey","venue":null,"work_id":"1df93bbf-f78a-4a8c-8ee4-c725b5718901","year":2021},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.022425Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:75900136225f033bef2070db23142330d88711be24df6e71f63f3d126bc881a1","observation_id":"09e33535-a780-44d2-b0b7-5cc90c7db377","resolution":{"observed_at":"2026-08-16T04:17:00.282967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.268196Z","title":"En- couraging lstms to anticipate actions very early","venue":null,"work_id":"59a7058b-cf21-4d5a-8d50-57b4c64bc7e2","year":2017},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.026392Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:afd2c3d5b8c6ff6c637b2526c430ee51a9ebc1722aee4c1702dfdeeb9949ef5d","observation_id":"d3bb4032-a725-4d2c-8655-b13187b891e1","resolution":{"observed_at":"2026-08-16T04:17:00.272008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T04:17:00.033906Z","title":"Llama: Open and efficient founda- tion language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.033906Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:cb4c1489e19025a5897cb34d29f4108386237dd2329cccc976129f5ef8aa8629","observation_id":"16c508a7-dc07-4503-8466-14239cd0594a","resolution":{"observed_at":"2026-08-16T04:17:00.033906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.038188Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.038188Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:8aa5e3b60c5e3a65c70f1ee865481c7c75eca8ee5371c3c6438d88dec0609025","observation_id":"4cbdc48c-decb-4d83-b840-7caa03f667ff","resolution":{"observed_at":"2026-08-16T04:17:00.038188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.237342Z","title":"Memory-and-anticipation transformer for online action understanding","venue":null,"work_id":"3e0539a6-4172-4f7d-9dac-d329b5d70bba","year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.042922Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:d8c410bf5e23d64871f94ca1bb7d2631cdd3d7e4e3a268b0ff25253259da6ca8","observation_id":"fb7b1e05-d3c1-452c-b982-e326b95fba8c","resolution":{"observed_at":"2026-08-16T04:17:00.241348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.225133Z","title":"Visionllm: Large language model is also an open-ended decoder for vision- centric tasks","venue":null,"work_id":"1ffbbabd-03b3-4f03-b725-9021488a6a30","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.046487Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:23f9b037d077bd163acb5f3920057184e92cb24a3bdf246981cbb0991dcc6861","observation_id":"bd421d6a-6661-470d-a005-533be7b31b9e","resolution":{"observed_at":"2026-08-16T04:17:00.229477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.212969Z","title":"Black-box prompt tuning for vision-language model as a service","venue":null,"work_id":"7f103eb3-1a3c-4c83-bffc-92a70ad457fa","year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.050599Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:ab79b9cccbfe0c7c6f87b06a4f52d8bbf5e49f146d2cb0701d30a6d10c734679","observation_id":"a4cae2e8-dbf4-46f2-8399-6c957c1fc5fb","resolution":{"observed_at":"2026-08-16T04:17:00.217089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16368","last_updated":"2024-04-01T01:33:53Z","snapshot_observed_at":"2026-08-21T13:17:32.111537Z","submitted_at":"2023-07-31T02:14:19Z","title":"AntGPT: Can Large Language Models Help Long-term Action Anticipation from Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16368","snapshot_observed_at":"2026-08-16T04:17:00.054405Z","title":"Antgpt: Can large language mod- els help long-term action anticipation from videos? arXiv preprint arXiv:2307.16368,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.054405Z"},"links":{"cited_paper":"/paper/2307.16368","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:986ad93c09c521e07c1e92091636c770689fd0fe007b4c3fb214cf702e1d8164","observation_id":"0aacd786-8ec1-4f77-87aa-06406453995e","resolution":{"observed_at":"2026-08-16T04:17:00.054405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.199952Z","title":"Anticipative feature fusion transformer for multi-modal action anticipation","venue":null,"work_id":"7dc0c8c7-0b53-4dba-8dda-076deb864032","year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.058814Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:b8cbfb987486f9153f5dfdc11560455461070b18370bc79fc876b18d1063fea9","observation_id":"9b5082f4-f0f6-471b-a946-3db1f8ecd69b","resolution":{"observed_at":"2026-08-16T04:17:00.205522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.186488Z","title":null,"venue":null,"work_id":"75813d6d-ea2f-4514-8939-e4b2dfdcd48e","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.062338Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:88551be1924bbf0a480b9e22627f3f0c895ce8f9a51b4ec2c1fe44e89ddbc7a7","observation_id":"380a38c4-06a5-40fc-9484-30e59dd93977","resolution":{"observed_at":"2026-08-16T04:17:00.190975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04184","last_updated":"2024-07-04T23:13:06Z","snapshot_observed_at":"2026-08-21T13:17:26.328154Z","submitted_at":"2024-07-04T23:13:06Z","title":"QueryMamba: A Mamba-Based Encoder-Decoder Architecture with a Statistical Verb-Noun Interaction Module for Video Action Forecasting @ Ego4D Long-Term Action Anticipation Challenge 2024","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04184","snapshot_observed_at":"2026-08-16T04:17:00.065856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.065856Z"},"links":{"cited_paper":"/paper/2407.04184","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:2912ea45bdc39f67454b0e670a5ec88ee53313b6707b3160536b8c48784626b5","observation_id":"9f27aa03-8246-463c-ba20-1948ea37e648","resolution":{"observed_at":"2026-08-16T04:17:00.065856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:16:59.941847Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":1964,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.941847Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:98370cddb312bd44ace84e641108eeba36352a7f6fbf9c1776e0bf7df63f6f7a","observation_id":"47abcfae-6f50-438f-9b37-0320acd41712","resolution":{"observed_at":"2026-08-16T04:16:59.941847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.377537Z","title":"In the eye of beholder: Joint learning of gaze and actions in first person video","venue":null,"work_id":"4610d11b-6277-48e9-a753-4bed76f73ba7","year":2018},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.985408Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:2de04545d3d6764c9f2048dc9d45c2157f2a5954a9b2ebaf6ca2be36366be118","observation_id":"949ff927-2b61-4868-908f-17012bb77f5d","resolution":{"observed_at":"2026-08-16T04:17:00.381374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.256671Z","title":"Temporal aggregate representations for long- range video understanding","venue":null,"work_id":"71d1635d-be37-4706-b853-ac5f5d2600ee","year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T04:17:00.030334Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:418c3e585b95e24b8191c2a7eacbc9c3845a45e3a1437ad6efc271c48aebdc1f","observation_id":"aacadb1e-17b2-429d-98c5-224a8eeea937","resolution":{"observed_at":"2026-08-16T04:17:00.260535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.366177Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"3b4011b2-e485-43d2-af42-acc53b7ffcaa","year":2023},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.988587Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:695c1b0d2e14b95dc0560a55b7ba9b743359d4e86f283453c60d32302c00f042","observation_id":"ac976ea0-fd66-4dfc-a8d4-9caf30491c62","resolution":{"observed_at":"2026-08-16T04:17:00.370295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05143","last_updated":"2019-10-13T09:44:11Z","snapshot_observed_at":"2026-08-18T09:03:53.826419Z","submitted_at":"2019-05-13T16:57:40Z","title":"VideoGraph: Recognizing Minutes-Long Human Activities in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05143","snapshot_observed_at":"2026-08-16T04:16:59.962650Z","title":"Videograph: Rec- ognizing minutes-long human activities in videos","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.962650Z"},"links":{"cited_paper":"/paper/1905.05143","citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:9f7bc4b7f08fea29a5377d0e240f5b35739088b41aa7f5cd11e38c7cea6ffca7","observation_id":"c9658f80-6d31-4319-83dd-b9d99b0cb6ed","resolution":{"observed_at":"2026-08-16T04:16:59.962650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.508297Z","title":"Sgdcl: Semantic-guided dynamic correlation learning for explain- able autonomous driving","venue":null,"work_id":"8c2cfc9d-7a62-4276-bc4a-8a661d07a231","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.926640Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:82dccfa6a99ad836651907223d7a10454e3f5976fea3c3f4da6d34579ba81075","observation_id":"4bec848c-3850-4325-bb76-ae7419bda8a5","resolution":{"observed_at":"2026-08-16T04:17:00.512190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.433085Z","title":"Using gaze patterns to pre- dict task intent in collaboration","venue":null,"work_id":"239ecec5-aeee-4a92-b2f6-0a63e3295d25","year":2015},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.959028Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:b0a9871ae8d63b13b4db74f8a2fd0ce89e4830f834a35c716a5e0b4f6a854148","observation_id":"29be6859-98f4-457e-bdce-8813f3155c1e","resolution":{"observed_at":"2026-08-16T04:17:00.436667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.443240Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"baa44689-e419-444e-bc7d-faff97a6222d","year":2022},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.951867Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:3b7f9a7114080f1e97f95bcbc78bb9d820e6802d3db5a2e2b9a272bf12efd21d","observation_id":"6ccbc618-a512-4251-bba8-0a34906fb4d4","resolution":{"observed_at":"2026-08-16T04:17:00.446800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:16:59.921983Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.921983Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:8b55b96b1a8de184d917da1292a70e6e1f67324f8c1777fab669fbb8e84c4cfd","observation_id":"84f25e48-fe3f-435f-b837-06d6e38768f7","resolution":{"observed_at":"2026-08-16T04:16:59.921983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.497055Z","title":"A survey on multi- modal large language models for autonomous driving","venue":null,"work_id":"7d0ffc27-9be4-4b46-af2d-460fbebd7318","year":2024},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.930383Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:1989cb112328d095e0a7cfec49a2b8988a88bfc8b36966c44bca52c8a659398a","observation_id":"79d26287-c79d-4db5-9add-acee4bed298e","resolution":{"observed_at":"2026-08-16T04:17:00.500801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:17:00.342720Z","title":"Ego- centric video-language pretraining","venue":null,"work_id":"1b476ee7-d7eb-4de7-9b84-824db5a899c1","year":2022},"citing_paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T04:16:59.995283Z"},"links":{"citing_paper":"/paper/2505.01713"},"observation_digest":"sha256:139d96ddf6319644b5026d2f0fa0cac674cb44718b2adfddc849f0d1a5b8c44a","observation_id":"0b1b8fc5-8d06-4414-b6b2-03dd8cd766a8","resolution":{"observed_at":"2026-08-16T04:17:00.346589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.01713","last_updated":"2025-05-03T06:33:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:04:10.490644Z","submitted_at":"2025-05-03T06:33:54Z","title":"Vision and Intention Boost Large Language Model in Long-Term Action Anticipation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.01713."}