{"as_of":"2026-08-18T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57863324dc456c35eaa5402265637b148ef84877523739a6f08e83146dfc69d3","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:26:46.275801Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:15:57.832559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:27:40.053520Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"cited_work":{"arxiv_id":"2508.12349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12349","snapshot_observed_at":"2026-07-03T05:27:40.053520Z","title":null,"venue":null,"work_id":"74d97ce3-d892-4910-97db-66a553811b5c","year":2025},"citing_paper":{"arxiv_id":"2606.10743","last_updated":"2026-06-09T11:53:29Z","snapshot_observed_at":"2026-08-03T12:18:51.370506Z","submitted_at":"2026-06-09T11:53:29Z","title":"Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:15:57.832559Z"},"links":{"cited_paper":"/paper/2508.12349","citing_paper":"/paper/2606.10743"},"observation_digest":"sha256:81190749dfd1b3706549feead3a5618b1b94e2613ecc035820de46daa22e4198","observation_id":"87ec612f-6da8-423a-8a91-272550ce748d","resolution":{"observed_at":"2026-07-03T05:27:40.054754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.12349/citation-record","integrity":"/paper/2508.12349/integrity","json":"/paper/2508.12349/citation-record.json","paper":"/paper/2508.12349"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.724643Z","title":"The evolution of first person vision methods: A survey,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.724643Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:212ad14a396b9e3a6882d6923c9e87094c2df1c1001a87cd8a2878a4844b26b3","observation_id":"0ddef51b-d9a1-4bf7-b5c6-744f33c0fb77","resolution":{"observed_at":"2026-08-15T17:26:45.724643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.731247Z","title":"An outlook into the future of egocentric vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.731247Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4b149df264c48369225e3fb85c58523db096131cf997e1f76878c4f8d5c05285","observation_id":"8be6dd7b-ca3a-4f51-81b5-1507241e0f7f","resolution":{"observed_at":"2026-08-15T17:26:45.731247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.738039Z","title":"Analysis of the hands in egocentric vision: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.738039Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:9128e1fa074b3698502aef7560a8e30293eb083ce59ad6b9e60463c8e34080a1","observation_id":"9d14f76c-19e9-4d51-9441-18154299d6a8","resolution":{"observed_at":"2026-08-15T17:26:45.738039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.744361Z","title":"Bigs: Bimanual category-agnostic interaction reconstruction from monocular videos via 3d gaussian splatting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.744361Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:6aa425f62a3f17e91cfed44887fbd265a17abe041ba529feb8af0ec66797792c","observation_id":"6d6edf90-d6f8-45e3-82fe-defb9091b9e5","resolution":{"observed_at":"2026-08-15T17:26:45.744361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.751807Z","title":"Easyhoi: Unleashing the power of large models for reconstructing hand-object interactions in the wild,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.751807Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:dac03815ef4d2988972c2ec1cf682060893e175fc72ef6278ca1bedf393bc133","observation_id":"4b53689e-8a2f-438f-88a1-b38b407ead27","resolution":{"observed_at":"2026-08-15T17:26:45.751807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.758489Z","title":"Diffusion-guided reconstruction of everyday hand-object interaction clips,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.758489Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e1c5dd0fc1f11db581d0516891ce2d214b2c332507fa61abd702249ce8a86831","observation_id":"cb1d15ff-4f7d-42e2-af9e-171a00a749cb","resolution":{"observed_at":"2026-08-15T17:26:45.758489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.765143Z","title":"Hoid- iffusion: Generating realistic 3d hand-object interaction data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.765143Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:abad5bb850e97c6eb07a70a69063fc21b8ce07d376a73f148cd7d6bf6f49be82","observation_id":"905290b1-baa3-4969-812d-335846a51b34","resolution":{"observed_at":"2026-08-15T17:26:45.765143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.522927Z","title":"Gears: Local geometry-aware hand-object interaction synthesis,","venue":null,"work_id":"b2c9a2b3-4ab3-4cea-8b73-14b90a59c7f8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.774024Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:5c0fb347769fed62e72b7735114b5d8c4ccc3135435648c73992246d8ebefe16","observation_id":"88e460b5-a7a8-4b1b-a14a-1d0e2630b153","resolution":{"observed_at":"2026-08-15T17:26:48.528897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.501928Z","title":"Reconstructing hands in 3d with transformers,","venue":null,"work_id":"7133b48b-b3b3-4161-b8ad-c2aeca32580f","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.779356Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:67cc01f1e23442d064e73954bb6e99fa017a0770901086aa13750d0a2872c163","observation_id":"bc1f8ba9-0d48-4748-b979-a94a785c4a43","resolution":{"observed_at":"2026-08-15T17:26:48.508148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.480872Z","title":"Consistent 3d hand reconstruction in video via self-supervised learning,","venue":null,"work_id":"0277abf8-253d-4eb6-800d-b61cd60b2c84","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.785025Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e5d18cb99d5a44f33917f3fedb34700ab8f9cd8ac67eea2fb3053482e60df7d3","observation_id":"d805cd3f-5019-44f9-8823-5e6937b99131","resolution":{"observed_at":"2026-08-15T17:26:48.486909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.459323Z","title":"Pyramid deep fusion network for two-hand reconstruction from rgb-d images,","venue":null,"work_id":"edf269b6-58ee-444b-890d-865fe6782008","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.791737Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:42ad1aaef25433ba272fb9f0b9c5f74760f9e9faf4050257839acd9bb7fbbba2","observation_id":"d78e4ad9-34c3-4aed-8d3f-ffc91a6dc859","resolution":{"observed_at":"2026-08-15T17:26:48.464965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.438507Z","title":"Hhmr: Holistic hand mesh recovery by enhancing the multimodal con- trollability of graph diffusion models,","venue":null,"work_id":"497b3491-e813-41a0-9c07-86a06f0c7e11","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.797886Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:735279d412d9c2b7655b372e6e40ff6b772bd04d6ea049b136eceeb160169c1d","observation_id":"679da222-f85d-44b6-ba30-d5eed664f228","resolution":{"observed_at":"2026-08-15T17:26:48.445809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.413077Z","title":"Recovering 3d human mesh from monocular images: A survey,","venue":null,"work_id":"7612695f-dcaa-4340-9006-33dbc287ec4a","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.804971Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b9abf516eb521c3753410a08a8055a657ea8611dc215b5c8f3c834c3d85d2661","observation_id":"17a054b6-2058-44ce-8bad-a2125e1c078c","resolution":{"observed_at":"2026-08-15T17:26:48.422121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.391423Z","title":"Fine-grained egocentric hand-object segmentation: Dataset, model, and applications,","venue":null,"work_id":"e484ea36-4740-4ac2-861a-721115a74cfe","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.813131Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:6ff2ffbc4869560d9dedae6c3b706eb1593e9f70f1205a195459c2315961d48f","observation_id":"7a7ec25f-ee0c-46a1-b694-9cfc27942e94","resolution":{"observed_at":"2026-08-15T17:26:48.398278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.369565Z","title":"Egocentric prediction of action target in 3d,","venue":null,"work_id":"0eb265cb-a7dd-4039-99bd-3f7db2255f40","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.822738Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4ec9c0ee51c7ac5d911ab9af81118f2bd067996f4e1713fa63f05e7c5981f1e4","observation_id":"94256934-f091-4965-962e-db07ed722ab2","resolution":{"observed_at":"2026-08-15T17:26:48.377687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.350816Z","title":"Precision-enhanced human-object contact detection via depth-aware perspective interaction and object tex- ture restoration,","venue":null,"work_id":"d4e3c534-8706-4402-ac84-36ac7158a2a9","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.828994Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:41043754622c983ecd408f52918f34fb8fcc9db130a16ff5f5aad123cc9dbfcf","observation_id":"f82d04e7-fed1-4838-9678-7fcf8dca5926","resolution":{"observed_at":"2026-08-15T17:26:48.356163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.328173Z","title":"Interaction region visual transformer for egocentric action anticipation,","venue":null,"work_id":"5e2343bb-6982-44e7-9fe5-72ee2e123f30","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.834520Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a823b7da067d9ef262ae99aa2a47e6f56b1f934f81da37b18165cbe49ef887f2","observation_id":"baa5524a-14f2-4623-a2a7-6f593db60a7b","resolution":{"observed_at":"2026-08-15T17:26:48.336875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.310102Z","title":"Under- standing atomic hand-object interaction with human intention,","venue":null,"work_id":"0308d66e-6b26-4836-af04-90a24451d123","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.840902Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c2e1b7ef1f5f0dd59e05eb1547b2a21ec4d6f8d64f161a1b69e97e0d5fd4d1b2","observation_id":"ed038ce5-f6e7-4247-b627-4d7130470c6e","resolution":{"observed_at":"2026-08-15T17:26:48.315285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.288292Z","title":"Graph convolutional module for temporal action lo- calization in videos,","venue":null,"work_id":"dc32da2c-918f-421e-b2c9-8cbdf11eacc6","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.847312Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:fb9c659173a82478afe0ca4907312972e302de7b92735661e5d110a370fda1fb","observation_id":"e9fda984-7528-4d80-acb5-8347180af56a","resolution":{"observed_at":"2026-08-15T17:26:48.295851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.267960Z","title":"Vectorized evidential learning for weakly-supervised temporal action localization,","venue":null,"work_id":"b62a5ff4-c13c-4fcc-a74e-29027b19578d","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.853113Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:dbd3c897359859898a6256849263464abaa412a7493c3d3d3299ae4ca48e00cc","observation_id":"cf7d821f-15ba-4254-9c13-64cda55407f4","resolution":{"observed_at":"2026-08-15T17:26:48.273835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.234934Z","title":"Opental: Towards open set temporal action localization,","venue":null,"work_id":"a21bc157-4c67-47a8-bb03-beebdb5f1cee","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.860218Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4dd170c7e80143bf47bb8c0519e11841cf88900865512843eb097790cdbc5623","observation_id":"6bae1e62-86ee-474d-8f94-551a73ddb0a7","resolution":{"observed_at":"2026-08-15T17:26:48.255123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.216586Z","title":"Detal: Open-vocabulary temporal action localization with decoupled networks,","venue":null,"work_id":"dc9283a1-5bc8-4429-9e88-180ed6d0a812","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.867420Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:33456cd54f2b468d5e1293ecd5c1b1e73bbc2ce7cfff30fffb0acce1a9ce21f7","observation_id":"eeb985a1-cdca-41e2-b8be-2a4d528d3253","resolution":{"observed_at":"2026-08-15T17:26:48.222313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.197379Z","title":"Transferable unintentional action localization with language-guided intention translation,","venue":null,"work_id":"816ebc2a-5d27-44f4-96c7-e485b55fce45","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.873573Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c1db95f5a1eec460872fce9033e571cee9ea24c4f32667b7598ac72db8239580","observation_id":"a77b1ebc-3ddf-416b-b180-bbe357c917f7","resolution":{"observed_at":"2026-08-15T17:26:48.204307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.175500Z","title":"Ual- bench: The first comprehensive unusual activity localization benchmark,","venue":null,"work_id":"7960de88-5b60-4188-a62f-122cbc05da79","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.879350Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c9de8e97d0adfa0f93d48d064f9dae3deb79a545037878163b6df54a1609a80c","observation_id":"d6db97f4-bda1-4b8e-99a8-b7f6e21e44b2","resolution":{"observed_at":"2026-08-15T17:26:48.180810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17422","last_updated":"2025-04-07T10:55:13Z","snapshot_observed_at":"2026-08-16T13:22:34.690877Z","submitted_at":"2024-08-30T17:12:14Z","title":"Open-Vocabulary Action Localization with Iterative Visual Prompting","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17422","snapshot_observed_at":"2026-08-15T17:26:45.890759Z","title":"Open-vocabulary action localization with iterative visual prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.890759Z"},"links":{"cited_paper":"/paper/2408.17422","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:7ffaf597da58a9d4c14677221f25ba4f0556e6e083dc5c6a6db5f69ea465caab","observation_id":"22f6b5d3-578b-4791-bf2b-8b1e2601ab37","resolution":{"observed_at":"2026-08-15T17:26:45.890759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15556","last_updated":"2024-06-21T18:00:05Z","snapshot_observed_at":"2026-08-16T13:40:38.811614Z","submitted_at":"2024-06-21T18:00:05Z","title":"Open-Vocabulary Temporal Action Localization using Multimodal Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15556","snapshot_observed_at":"2026-08-15T17:26:45.901479Z","title":"Open-vocabulary temporal action localization using mul- timodal guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.901479Z"},"links":{"cited_paper":"/paper/2406.15556","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2c60e253bf3c8487ce8db985ae7df20305640285feee16ecce9da42e6453b946","observation_id":"45b3bafe-17c7-489e-ba9c-6262b6d84aca","resolution":{"observed_at":"2026-08-15T17:26:45.901479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.910307Z","title":"Motion tracks: A unified representation for human-robot transfer in few-shot imitation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.910307Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:84ef307a40657f0c70c9d6e5dfdfa5d8d92007f406784ae6f868109221cb6ad1","observation_id":"32c0577c-f7e6-4c18-b8a1-b60c1bd73440","resolution":{"observed_at":"2026-08-15T17:26:45.910307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.157682Z","title":"Vlmimic: Vision language models are visual imitation learner for fine-grained actions,","venue":null,"work_id":"996441ee-8172-4dac-905c-a22ba8dbd4b8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.917362Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:1e32951471324b836953ce9415c7d4964deab971a8c119ec27799a7a0acd9590","observation_id":"c53db613-5422-4e9e-b000-24693edb3cfc","resolution":{"observed_at":"2026-08-15T17:26:48.164374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:45.925425Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.925425Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:5c8a9ddd7f0d5d0c531f5d1b068e8fc599e6a1837d79cd2f0d3706125dceb1bd","observation_id":"4520b5e9-6aaa-4f2b-b704-8ab5409b7ee8","resolution":{"observed_at":"2026-08-15T17:26:45.925425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-15T17:26:45.930770Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.930770Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:1b11df958acf9ffa713a11446e0b1426ea058621e1d8a97ddc313149e765b5a0","observation_id":"6b39b5e9-9ede-4ca1-a6ff-205355056b20","resolution":{"observed_at":"2026-08-15T17:26:45.930770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.141506Z","title":"Zero- shot temporal interaction localization for egocentric videos,","venue":null,"work_id":"3e162eea-e7dd-4d97-ae14-c48e711ff400","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.936410Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:11f8a4da337262353127e83460ef0ad534c79e0ddd913c9a15d3e16f6b329106","observation_id":"3276ccfd-7eaf-4ada-b53f-01d622c07b5d","resolution":{"observed_at":"2026-08-15T17:26:48.146464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.125565Z","title":"Graph convolutional networks for temporal action lo- calization,","venue":null,"work_id":"058c3693-3e02-46ab-b764-0fec0e8a4c69","year":2019},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.942125Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a4efcddbceddf3fb99cd41edebe83e8644b49d3e02454797ffa39116dd5d23da","observation_id":"e89ec9fb-e0ed-4c55-b0ab-4e9cfbc555e5","resolution":{"observed_at":"2026-08-15T17:26:48.130502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.104450Z","title":"Zeetad: Adapting pretrained vision-language model for zero-shot end-to- end temporal action detection,","venue":null,"work_id":"91dc4e36-079a-42c7-b542-4b0b8b17c87c","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.948125Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:6e9885c15cb1e27c3d8a34c0e537a917e1ac73f0dca065cd82c812f3e6a5917c","observation_id":"786bb426-4a95-40d7-801a-a57b45cbbe67","resolution":{"observed_at":"2026-08-15T17:26:48.109657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.086333Z","title":"Unloc: A unified framework for video localiza- tion tasks,","venue":null,"work_id":"92cb2b7c-283f-4a43-825b-18a320ce8f26","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.955928Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:de5c778122c477631ce6ff6fbdc7b660dbb577d4ec099684c385f2a29806da43","observation_id":"c1fbce81-d6ad-4cb2-a0ad-c37946e91502","resolution":{"observed_at":"2026-08-15T17:26:48.091805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.062753Z","title":"Deep learning-based action detection in untrimmed videos: A survey,","venue":null,"work_id":"b6363c4f-3a8b-478a-b53f-6e0ae9ffc184","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.961310Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:35628c2eeef64d467a9851525800a0df2c4267930214eb4dce6559d5524648e9","observation_id":"3fbfc089-a4df-44be-8803-04ea5647a21d","resolution":{"observed_at":"2026-08-15T17:26:48.069275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.045073Z","title":"Dynamic sampling networks for efficient action recognition in videos,","venue":null,"work_id":"9b2d221f-a661-4a5e-ae50-29f3fa45a117","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.967893Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:493718b3549d6f968c8d50a56c9188d4678098b1128133769f9f0707acd334f4","observation_id":"14077026-dc38-4fc8-884c-0178c04ecfaf","resolution":{"observed_at":"2026-08-15T17:26:48.050365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.027225Z","title":"Evidential deep learning for open set action recognition,","venue":null,"work_id":"1247b518-7733-4b7e-b74d-95726033ccb4","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.973053Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d0d9f8db639efaf6d8dc43afa4e87e071e4e1cd99f89962dfa64e65f0af4f045","observation_id":"e42bb345-fde4-431e-a560-951428504c11","resolution":{"observed_at":"2026-08-15T17:26:48.033355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:48.010539Z","title":"Egocentric action recognition by capturing hand-object contact and object state,","venue":null,"work_id":"b700ec12-8c03-4f8f-b000-959c1977d6d3","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.978469Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:cd13157d3e7cc72f6877702956668db97f2893ad043c4237c1f820a6f1962015","observation_id":"840df3a1-b15f-4d18-b616-67627716478c","resolution":{"observed_at":"2026-08-15T17:26:48.015439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.994448Z","title":"Infogcn++: Learning representation by predicting the future for online skeleton-based action recognition,","venue":null,"work_id":"c5ae2544-d2fa-4d1c-8339-14650455f5e8","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.984649Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e0d20e542c2b9c2eeeec9b0455df48cf1a1821c93f7d68eca687c47083df5e82","observation_id":"f8535856-2f6a-4313-974d-bd7034d43012","resolution":{"observed_at":"2026-08-15T17:26:47.999228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.978238Z","title":"Referring atomic video action recognition,","venue":null,"work_id":"be8076e0-6748-499b-8dfd-cb5f39fac160","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.989870Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:0da070bf4f742cc1fc64a1db8d639b8a1f8af97f228c4a3a11fd17eab77dd444","observation_id":"eaf14208-30be-4c2c-a7ba-9e7896d08ddd","resolution":{"observed_at":"2026-08-15T17:26:47.983401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.960800Z","title":"Temporal action localization in the deep learning era: A survey,","venue":null,"work_id":"e3bd3c93-a15f-457f-bd40-475f7800f2a1","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:45.995092Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:65a4799459780e0cbe4866f61ac1abb17e57a0fa173175c6ea08ea9bba200b58","observation_id":"c21f2e4c-30ed-425b-8b46-18d3f1f86c1f","resolution":{"observed_at":"2026-08-15T17:26:47.965979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.944362Z","title":"Prompting visual- language models for efficient video understanding,","venue":null,"work_id":"bd895de7-2daa-4f2a-a330-8a5b645879f7","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.005388Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:af0a8946ff5eb140938a180259a0ff15ae314d79fb04fad095f11d24588c0800","observation_id":"b445762c-03b8-46a5-a25c-23634cd7b214","resolution":{"observed_at":"2026-08-15T17:26:47.948944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.928414Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":"948305c1-8040-413e-84aa-f37dd08e3576","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.011008Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e178904f31680ec1d516b039941e0b875c64e673ac3c10cfd1719989b7385ed4","observation_id":"d94b51fd-e40c-4bc6-a522-f0436cfd5cea","resolution":{"observed_at":"2026-08-15T17:26:47.934010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.911540Z","title":"Zero-shot temporal action detection via vision-language prompting,","venue":null,"work_id":"cf7f627c-aa8d-4559-9ae4-0ff2b3bea735","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.017539Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:80ede4318e2adacede305a30c19f749eaceb4d9c9ee3ebea3d3dbbd0da1062e6","observation_id":"e09da0c1-5e2e-4bed-b4a4-06a93bd54a21","resolution":{"observed_at":"2026-08-15T17:26:47.917303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.893622Z","title":"Zero-shot temporal action detection by learning multimodal prompts and text-enhanced actionness,","venue":null,"work_id":"2013f2cd-ef59-4a76-b8d4-2a8e2f071318","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.023624Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:39c5992f38888af16ce626f45b308df7d99edaf40f39d8cc79615d8a271f2d30","observation_id":"f71f5dc3-e50c-49ee-b814-3a44b111c03b","resolution":{"observed_at":"2026-08-15T17:26:47.898880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.877620Z","title":"Test-time zero-shot temporal action localization,","venue":null,"work_id":"53169e58-3441-49af-b989-c70a0a138dea","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.028772Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:fe67f76862480ada03e91db2a0b09b68fe1b74d3aa414cca0bbcb03d48a7a539","observation_id":"625eee44-f223-4d7c-87b6-81313c0328a6","resolution":{"observed_at":"2026-08-15T17:26:47.882409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11732","last_updated":"2023-03-21T10:40:13Z","snapshot_observed_at":"2026-08-16T15:46:36.586163Z","submitted_at":"2023-03-21T10:40:13Z","title":"Multi-modal Prompting for Low-Shot Temporal Action Localization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11732","snapshot_observed_at":"2026-08-15T17:26:46.033644Z","title":"Multi-modal prompting for low-shot temporal action localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.033644Z"},"links":{"cited_paper":"/paper/2303.11732","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c549195fad4bbeaad82458fb4c14e0b0f32f17c5dcf3f63cd9d316c2ea0d6470","observation_id":"95163f6e-5f23-4d85-a118-a86dd36568ac","resolution":{"observed_at":"2026-08-15T17:26:46.033644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.861255Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"ce972087-ef33-467a-997c-66566d2c6ce6","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.038900Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:c9ecaa187cb125e05928e2466df982589d6b33d2884af360f29fd86eca00773a","observation_id":"7132f8f9-0c23-4084-898b-682527d22718","resolution":{"observed_at":"2026-08-15T17:26:47.866718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.845734Z","title":"Zero-shot video moment retrieval from frozen vision-language models,","venue":null,"work_id":"506b687d-66fb-43c2-adeb-e543aa0a01ea","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.044416Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b0e8282154ccfdcb270a461ed3788c2e3c270f8d104990b166dced349ea06b5f","observation_id":"937186ee-6180-4699-8743-1e95f4b306a7","resolution":{"observed_at":"2026-08-15T17:26:47.850743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T17:26:46.052318Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.052318Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:34b3bb0ad07baf23bead32383d276a273fd41311a6d25af1339e0f41ca6b9b40","observation_id":"9480f719-9044-4360-9fbd-c9cfff8227bf","resolution":{"observed_at":"2026-08-15T17:26:46.052318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.631075Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-15T17:26:46.057999Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.057999Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ee8229a5f3ec25f165025424ca9033c2b1dd595ee3cfd6c8917080620aedca08","observation_id":"db4bb1ff-e23a-4481-8c5a-cb60b7602da8","resolution":{"observed_at":"2026-08-15T17:26:46.057999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.822978Z","title":"Forecasting hands and objects in future frames,","venue":null,"work_id":"c09b0aed-772a-41fb-bbbc-cf8fc6236794","year":2018},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.064904Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2ab5bf88415bd26db236316a7e8335bd3eec46a0c7a6795234faed575ece69e8","observation_id":"c614b675-e658-4a2d-9169-84f2bdd85d1f","resolution":{"observed_at":"2026-08-15T17:26:47.831466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.801174Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"5058cdbc-8081-46fc-90f3-0c3761d6be08","year":2018},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.070513Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:41a064dc60ac40fa1ba24d1ed2ab4b4257c07265a1526a4af78cbc29b3892fd3","observation_id":"6fd4f90d-9384-456d-8d40-65805db9435d","resolution":{"observed_at":"2026-08-15T17:26:47.808278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.782039Z","title":"Understanding human hands in contact at internet scale,","venue":null,"work_id":"49c21ef0-1edf-46e4-972c-e5c6593c1820","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.091274Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ce3b08719d976a2399a89b223968a940cbe78c182acf1fb88ee4253755c9f405","observation_id":"f1d00eb0-007b-4efe-adc3-bbf951222fe6","resolution":{"observed_at":"2026-08-15T17:26:47.789197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.759099Z","title":"Joint hand-object 3d reconstruction from a single image with cross-branch feature fusion,","venue":null,"work_id":"9f4c5dbb-068e-4c61-9572-6e19f0899d51","year":2021},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.097126Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:68a47258452b6a5247f4c1c25c193348c87d47a44009d7c2cad4b0204fa325e2","observation_id":"420de195-53ee-42c6-9718-f231ce5da600","resolution":{"observed_at":"2026-08-15T17:26:47.766643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.739667Z","title":"Interacting hand-object pose esti- mation via dense mutual attention,","venue":null,"work_id":"f3b778c1-7797-4cb4-bda2-409e1357bedc","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.102215Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e2a95fd70e07eede4a4bf9b719baabda88c7b5a074bfed56c887d8220f728c30","observation_id":"4879fdb5-518a-4dc4-be8f-a789ebed2451","resolution":{"observed_at":"2026-08-15T17:26:47.746068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.715015Z","title":"Affordance diffusion: Synthesizing hand-object interactions,","venue":null,"work_id":"b8640978-e1ca-409a-a731-89d40d707aef","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.107940Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:eb92ad52fddf98c15dd40b36dcfbd228d4660afddc942562ed58cc5a45dedd04","observation_id":"254ccc7b-e236-4502-9e8e-28b562b95bbd","resolution":{"observed_at":"2026-08-15T17:26:47.723754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.692814Z","title":"Hoi-swap: Swapping objects in videos with hand-object interaction awareness,","venue":null,"work_id":"d01088f4-ce1c-4c1b-8a11-39f6d22e83f9","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.114863Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4a7ccf4ecd808eab2ac69868e8544f5471d1b38e729bb05c5ac11f82296e7c19","observation_id":"0cdb92ef-bfbc-4a48-8f01-dd78e65cdbb2","resolution":{"observed_at":"2026-08-15T17:26:47.699641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.667613Z","title":"3d hand pose estimation in everyday egocentric images,","venue":null,"work_id":"a3991ead-7b7f-4923-a6d4-292574a6ed3c","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.121153Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e2e1b67a1b4583813284c00fc74c5f540934dca94884873fdd54c9a63345e357","observation_id":"d27bfdfe-ff12-4b45-9258-4d3cfb91889f","resolution":{"observed_at":"2026-08-15T17:26:47.674636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.646222Z","title":"Uncertainty-aware state space transformer for egocentric 3d hand trajectory forecasting,","venue":null,"work_id":"54414acc-9b88-4db0-b7da-2eda37fd9a4c","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.126702Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:faa11aaa472d6521304a9e98fabbc1fae34f1561d18a2ba1f40661d26d783bd8","observation_id":"e3f8de01-c265-45f5-aafd-3d82dadd8f01","resolution":{"observed_at":"2026-08-15T17:26:47.653984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.131778Z","title":"Diff-ip2d: Diffusion-based hand-object interaction prediction on egocentric videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.131778Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:2cceeba0b9a0a65287e930f4fae53a58fa9c7eaa807f0fc3b368ab0df7deb8fe","observation_id":"8b96217f-3554-4873-9801-31634ad1c05e","resolution":{"observed_at":"2026-08-15T17:26:46.131778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.137381Z","title":"Madiff: Motion- aware mamba diffusion models for hand trajectory prediction on egocentric videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.137381Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:d9a63167c36beee16794ab74bade51e659b0a45eea3d4ac85a100fd896ab597c","observation_id":"8af7508f-5a6e-416c-928d-485110777d39","resolution":{"observed_at":"2026-08-15T17:26:46.137381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.619038Z","title":"Can’t make an omelette without breaking some eggs: Plausible action anticipa- tion using large video-language models,","venue":null,"work_id":"28daeb36-ffa9-471c-bcd3-53b22e852757","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.142449Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:e413b4d6bc36627e18c11f0e746995002bbf03d280a3919a0f58f96eaa4d9d3b","observation_id":"7a30926a-2729-498c-8cd5-7aeda981e2ad","resolution":{"observed_at":"2026-08-15T17:26:47.628952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.593761Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"494f966a-bb84-497e-bdac-49a7f59cb6ee","year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.148073Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:1c87ba34eb128498cfeb3a251e40c1b7142bb75a96db41d38a7d1a1c574312cd","observation_id":"d6a0743a-77fb-4973-943d-a8c096159755","resolution":{"observed_at":"2026-08-15T17:26:47.602101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.568806Z","title":"Strategies to leverage foundational model knowledge in object affordance grounding,","venue":null,"work_id":"08e19a6c-f165-4c60-8fd9-702f1d6a71c1","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.153369Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:5b0a410efd224abcd5866b8fdf253b3d07769583748c1a247101c53d0a6b9752","observation_id":"1dca1e98-f7e7-4e98-b51d-d72fca1272b4","resolution":{"observed_at":"2026-08-15T17:26:47.576269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.547301Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models,","venue":null,"work_id":"45911d0f-856d-4d8b-ab30-cbca77507ad4","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.158574Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a18f5f563928a1e9d7743fa13e806a1e135253343ee48f04bfef00b1cad2c989","observation_id":"86b374eb-34fb-43fa-9985-a32d93e4a512","resolution":{"observed_at":"2026-08-15T17:26:47.555384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-12T19:55:27.838188Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03097","snapshot_observed_at":"2026-08-15T17:26:46.165458Z","title":"Egovlm: Policy optimization for egocentric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.165458Z"},"links":{"cited_paper":"/paper/2506.03097","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:8e397ede2ab6424da9b1619f77b700065348c0ffc9beba9d1e8b2cce6b719556","observation_id":"004476fc-40b1-40e2-bccc-5727d2f6faaa","resolution":{"observed_at":"2026-08-15T17:26:46.165458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.524829Z","title":"Smoothing and differentiation of data by simplified least squares procedures.,","venue":null,"work_id":"39ed9f20-317e-4673-a38c-49e1ea7da779","year":1964},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.172216Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:358b28e65e98d16a87e958efb2df7c9821745c0f6501677b503b7660f1994edc","observation_id":"d39501d2-aded-40ae-a781-fe2a29cdb324","resolution":{"observed_at":"2026-08-15T17:26:47.532044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.504049Z","title":"Choice of contact points during multidigit grasping: effect of predictability of object center of mass location,","venue":null,"work_id":"52e22705-cf07-4bb3-8945-102a61f5a224","year":2007},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.177238Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:7eeb9487b3a3734321825ff7ad2a5b21f157ebc6f9246af84d13182d9a1848c0","observation_id":"88ba594f-cfd2-44df-aeb5-0648451b2767","resolution":{"observed_at":"2026-08-15T17:26:47.511008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.476824Z","title":"Research on speed and acceleration of hand movements as command signals for anthropomorphic manipulators as a master-slave system,","venue":null,"work_id":"76aac1f8-ea11-45ff-a0a8-1c6c006cea02","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.182907Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b3d30fa03df1e664fbf649ba4dcc1eff333583f14d61e4cd73d441899c1a02b5","observation_id":"e6c07fb9-6a53-43ee-bae0-703eefad84be","resolution":{"observed_at":"2026-08-15T17:26:47.486802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.446135Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":"808e8fee-5406-4b44-b117-a56869d2188c","year":2022},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.189398Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:b35b9778406670ac857528d70a268150c2343c6ad18e554b7fc2e471769f8b67","observation_id":"73e454bb-3db8-4866-83b5-217581e8a217","resolution":{"observed_at":"2026-08-15T17:26:47.453770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-15T17:26:46.195656Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.195656Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:18c694452115d3c8f3ab41addba808e8a600afc910373ea72c7aca3ba201ed9e","observation_id":"120acae6-061e-49da-b510-3d2051b8d01a","resolution":{"observed_at":"2026-08-15T17:26:46.195656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.421516Z","title":"Lan- guage models are few-shot learners,","venue":null,"work_id":"4f589910-35f8-470b-b67b-e217d3456192","year":1901},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.202507Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:eb940037fbed89d7556dfb24b7b0b6d8c86eda5dffd55106f7c923fc675afab2","observation_id":"698d8ed8-b6ab-442c-b57e-481b844a24f2","resolution":{"observed_at":"2026-08-15T17:26:47.431120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-15T17:26:46.208003Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.208003Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:a6f4bbf5f71ae536a23c5dd2e725b6a90893e57603ae5bdfa1b57d1170b6c369","observation_id":"b9385bac-7421-4097-8d7d-8be2ee2b3f3c","resolution":{"observed_at":"2026-08-15T17:26:46.208003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20391","last_updated":"2025-02-27T18:59:18Z","snapshot_observed_at":"2026-08-18T01:52:56.604689Z","submitted_at":"2025-02-27T18:59:18Z","title":"Point Policy: Unifying Observations and Actions with Key Points for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20391","snapshot_observed_at":"2026-08-15T17:26:46.213716Z","title":"Point policy: Unifying observations and actions with key points for robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.213716Z"},"links":{"cited_paper":"/paper/2502.20391","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:405922f40c14954bdb7fe58482be0829c93b325c3a1a8f3f6697be196f3be220","observation_id":"6ca1f7c4-26b5-4249-aa17-df86b5991f09","resolution":{"observed_at":"2026-08-15T17:26:46.213716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20290","last_updated":"2025-06-03T22:50:28Z","snapshot_observed_at":"2026-08-13T14:30:25.903303Z","submitted_at":"2025-05-26T17:59:17Z","title":"EgoZero: Robot Learning from Smart Glasses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20290","snapshot_observed_at":"2026-08-15T17:26:46.219166Z","title":"Egozero: Robot learning from smart glasses,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.219166Z"},"links":{"cited_paper":"/paper/2505.20290","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:f22b6a789c6feacd08edacbc31f50020689af0859ff18a3657ee684078b8dfd1","observation_id":"4282b0ed-6bb9-4c99-a3cf-9e403eac7d43","resolution":{"observed_at":"2026-08-15T17:26:46.219166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.395259Z","title":"Benchmarking llms via uncertainty quantification,","venue":null,"work_id":"2ee2ed84-f338-4e91-8874-6c395ba4de08","year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.225208Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:89304df2ae3f5b6f2afeb37d9265a1aef8b931ba5e303165aa5043fe81acdeaa","observation_id":"928846b3-4d29-4eb9-a011-b133ed328716","resolution":{"observed_at":"2026-08-15T17:26:47.403664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15850","last_updated":"2025-06-03T22:16:32Z","snapshot_observed_at":"2026-08-16T12:48:24.492574Z","submitted_at":"2025-03-20T05:04:29Z","title":"Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15850","snapshot_observed_at":"2026-08-15T17:26:46.232837Z","title":"Uncertainty quantification and confidence calibration in large language mod- els: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.232837Z"},"links":{"cited_paper":"/paper/2503.15850","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:58d48088fef06a17f304420ad296abc489090a79fd7c07a8e27c326b5a5bcef7","observation_id":"e61e6569-5acd-400c-847f-2fcd7e441218","resolution":{"observed_at":"2026-08-15T17:26:46.232837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T17:26:46.238063Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodal- ity, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.238063Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:ec30dba1f125ccbaf21610929ff1f3e2cdcb2b28e162e4524e603344ee07202d","observation_id":"71251d19-784b-4d17-a541-bdfe0b72748d","resolution":{"observed_at":"2026-08-15T17:26:46.238063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-15T17:26:46.243073Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.243073Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:497998e103ac4e2ad8d314c8e63fc8031bc8a0ad13469b0e4219ea9ec362b01d","observation_id":"6957bc19-cc67-491e-a16e-56def8b7f8a6","resolution":{"observed_at":"2026-08-15T17:26:46.243073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.07375","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.510064Z","title":"Novel diffusion models for multimodal 3d hand trajectory prediction,","venue":null,"work_id":"277fff49-69c5-476c-96d0-5d615b4f4bcb","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.249220Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4dec03b43eba6b1af274381df48c9d6f7dc2ab4a2cd85865557f058922144650","observation_id":"482dfc3e-f5ac-400e-b42d-fc715ab49515","resolution":{"observed_at":"2026-08-15T17:26:46.520937Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12957","last_updated":"2025-04-03T10:12:23Z","snapshot_observed_at":"2026-08-16T13:33:18.623066Z","submitted_at":"2024-07-17T18:59:56Z","title":"R+X: Retrieval and Execution from Everyday Human Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12957","snapshot_observed_at":"2026-08-15T17:26:46.254801Z","title":"R+ x: Retrieval and execution from everyday human videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.254801Z"},"links":{"cited_paper":"/paper/2407.12957","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:99d8f94fbb8c9018823105f68c4e85c451868014eba0fd720839b0ca0c794366","observation_id":"3356358c-6a8c-47c8-a18b-ae2253ba4981","resolution":{"observed_at":"2026-08-15T17:26:46.254801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.370515Z","title":"Sapien: A simulated part-based inter- active environment,","venue":null,"work_id":"30a27338-7a9d-4345-af21-c1b08e2e94d6","year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.260613Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:595bfcbea40a082ce5a79bca4bcf44e25dd3deab33db928e503aaff1ed4eae48","observation_id":"0c6630dd-cb02-48d2-9d84-62a6a0f9f61a","resolution":{"observed_at":"2026-08-15T17:26:47.379657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:47.336810Z","title":"Articulated object estimation in the wild,","venue":null,"work_id":"a6b8beee-2b1d-40fc-8181-a462a72d9c32","year":2025},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.265626Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:676edc70099b0936279835aa32e2be7f760b0a4096b9c4d914d62c72c388c81e","observation_id":"95c2688a-490b-456f-bb4d-d8d0490b7a79","resolution":{"observed_at":"2026-08-15T17:26:47.350096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:26:46.270884Z","title":"Rolling-unrolling lstms for action anticipation from first-person video,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.270884Z"},"links":{"citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:4ec5a16434ce602e9737d0d912ea864ca4fcd4c84a144ec54dd420e4186fd323","observation_id":"4d05d8e2-a0a7-4f64-ba45-3eb187f433bf","resolution":{"observed_at":"2026-08-15T17:26:46.270884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T17:26:46.275801Z","title":"Adam: A method for stochastic optimiza- tion,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T17:26:46.275801Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.12349"},"observation_digest":"sha256:aa8ee047fd8ef0adebdd0f97c106a5cb73648de695727533d79a818ed18ca7f1","observation_id":"d1486dce-8c37-4b53-9197-e54fc451f50f","resolution":{"observed_at":"2026-08-15T17:26:46.275801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.12349","last_updated":"2025-08-17T12:38:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T01:53:41.837838Z","submitted_at":"2025-08-17T12:38:56Z","title":"EgoLoc: A Generalizable Solution for Temporal Interaction Localization in Egocentric Videos"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":57},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2508.12349."}