{"as_of":"2026-08-08T16:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dca43ddaa90ce4f77dcd8465f3364efd05d6968313a2f9bd6e535e5a73f59aaf","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:11:23.167054Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06411/citation-record","integrity":"/paper/2507.06411/integrity","json":"/paper/2507.06411/citation-record.json","paper":"/paper/2507.06411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.713876Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"7c2dd7e1-16ce-482f-a464-e937e1c49ec1","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:20.882065Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6f86891d0d7f47bd89c8514d0e0e0214e38145ae1ec2ce024cf31dfea6214ef6","observation_id":"3bb0926f-8a10-4230-ad41-a85e8fd943c2","resolution":{"observed_at":"2026-08-06T19:11:23.716270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.706317Z","title":"Boundary content graph neural network for temporal action proposal generation","venue":null,"work_id":"9b262563-d4c4-4b3b-8365-7e2cc400dcc9","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:20.974232Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:cfc065dc9e64c4708c7063ae8938ab5e4b42aba119126e16925411b4bce93bf1","observation_id":"1a6680cb-8762-4391-81b7-ce41f8b5dd50","resolution":{"observed_at":"2026-08-06T19:11:23.708965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.698659Z","title":"Is space-time attention all you need for video understanding? In ICML, volume 2, pp.\\ 4, 2021","venue":null,"work_id":"5b709ca0-5181-49f2-b3fd-7299986ddee3","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.050339Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:0caff5ded2de8bfd05156dfd8ead280df030da5f867586c914c5d50b89803d7a","observation_id":"cb8ad928-f109-4993-988f-da3c892ed12d","resolution":{"observed_at":"2026-08-06T19:11:23.701404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:21.058893Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.058893Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b76d727254dc0cbe0620c8134213d3625ea5878af8bc27970c0707b91f0c4aa6","observation_id":"9782d516-15c3-407c-8a6e-4a0bd220198b","resolution":{"observed_at":"2026-08-06T19:11:21.058893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:21.198988Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.198988Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:78bb04812ed6370fad50fe7511ee25101079ee0babc7262272f1119b1d06545d","observation_id":"0c634ced-25c8-4600-9973-d200475574cd","resolution":{"observed_at":"2026-08-06T19:11:21.198988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.681190Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"9ef981da-9191-47dd-a550-4bf633e518f9","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.379207Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:69087ba3f39a70eb4a6dd3da11244736ce43cdec29abb484c1fdc6ca1709400b","observation_id":"327cb808-0ffb-4d79-aa55-de7b86fc4cc0","resolution":{"observed_at":"2026-08-06T19:11:23.683764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.673773Z","title":"Augmented transformer with adaptive graph for temporal action proposal generation","venue":null,"work_id":"18fee6fb-d568-4c68-8b4f-14c34b583862","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.556748Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:c7c8ee966bfa7918c3ab6e2de3c706f68df9207e13f9a5438ecf8e27e3081842","observation_id":"6863284a-d72a-4c8a-84fa-63c2c7ceb57a","resolution":{"observed_at":"2026-08-06T19:11:23.676383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.665827Z","title":"Rethinking the faster r-cnn architecture for temporal action localization","venue":null,"work_id":"aa1c8a01-020e-4b5f-b6b5-70719eb7295e","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.763088Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:0855e27cf24e7199085dffe796927452b678aee835f8899035c5da44740a0926","observation_id":"30450159-c52c-4a87-beac-7eb5948a846a","resolution":{"observed_at":"2026-08-06T19:11:23.668516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.658253Z","title":"Dcan: improving temporal action detection via dual context aggregation","venue":null,"work_id":"ec3f9e83-9c06-4683-a3c6-b8cb42823663","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:21.874784Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f56f0ed2bc7b1afb2084565e051963ba5814f4acaf83bc6017bc46078ea3508d","observation_id":"d4f852a2-815a-4477-b816-6ebe8d60bf88","resolution":{"observed_at":"2026-08-06T19:11:23.660802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.650256Z","title":"Tallformer: Temporal action localization with a long-memory transformer","venue":null,"work_id":"f36c9088-362f-48f9-bd1c-43629c6ce891","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.026525Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6d116636b48e83cf757f2561419f3e05811515f5ed58bf20f1bb09692df617cd","observation_id":"aaa63d1a-3dde-4081-8385-85de56afb3a8","resolution":{"observed_at":"2026-08-06T19:11:23.652883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:22.154217Z","title":"Openmmlab's next generation video understanding toolbox and benchmark","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.154217Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:3c9984c546410245fff1ca7999acd8b9758715a8ed04ad627069f20a9b7fb190","observation_id":"a8bf9b64-ab4f-4b31-86f5-5fb2db2f5d0b","resolution":{"observed_at":"2026-08-06T19:11:22.154217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.637942Z","title":"Ms-tct: multi-scale temporal convtransformer for action detection","venue":null,"work_id":"8eaa0a83-d7f3-496b-894d-15f51492c1ec","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.275358Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:921e03299f77a60415db59d9c93f01bf1a62ae9b3e946bba4a92bf217880baa0","observation_id":"e765b488-c8e5-4a74-8f5b-c6eea73b8db1","resolution":{"observed_at":"2026-08-06T19:11:23.640570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:11:22.366775Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.366775Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:d807581fb78f91f2946bb20a0497594d07ad3d9a2569d37c595778c4d9ccbf7e","observation_id":"41181fe8-18c4-42e2-b456-b7f798de1df3","resolution":{"observed_at":"2026-08-06T19:11:22.366775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.631021Z","title":"Multiscale vision transformers","venue":null,"work_id":"b203fdd2-16e3-4622-9b5c-41428c42fdcb","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.574892Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:686c4c4c17b4440fa008ca7ad6d28128bed982d7d2fb001065c6f2db523f67a2","observation_id":"d6414fb9-bf20-4370-b0eb-407a5bb10e51","resolution":{"observed_at":"2026-08-06T19:11:23.633355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.623877Z","title":"Holistic interaction transformer network for action detection","venue":null,"work_id":"93109b18-8db8-4b5d-9108-e9d0399bdbde","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.710028Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:293836166f7842e4761285d9e07fc2e26cff5e448439a71045e75868305bc498","observation_id":"c0af44ff-4227-437a-ac75-cf3b2abb29de","resolution":{"observed_at":"2026-08-06T19:11:23.626452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.616321Z","title":"Turn tap: Temporal unit regression network for temporal action proposals","venue":null,"work_id":"92a908cb-835f-4651-b199-b4d25bc8f11a","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.790682Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:d258fa351f7423152949fd677293e29db7d72b116bd8245502d716413465fd44","observation_id":"04de8b7a-b8ab-4551-ab38-20b72a4a01e6","resolution":{"observed_at":"2026-08-06T19:11:23.618786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07493","last_updated":"2022-08-16T01:48:23Z","snapshot_observed_at":"2026-07-06T13:42:08.504017Z","submitted_at":"2022-08-16T01:48:23Z","title":"Temporal Action Localization with Multi-temporal Scales","version":1},"cited_work":{"arxiv_id":"2208.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.07493","snapshot_observed_at":"2026-08-06T19:11:23.243190Z","title":"Temporal Action Localization with Multi-temporal Scales","venue":"cs.CV","work_id":"cbc35859-d9d0-438e-8361-24f5529e7926","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.811371Z"},"links":{"cited_paper":"/paper/2208.07493","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6f1ca19e7d69c56f7c7ce5e4439150c00afd0d41aff3671d29bc0fb35bbeafc3","observation_id":"240de063-86ec-4962-a022-71f3f39a3f55","resolution":{"observed_at":"2026-08-06T19:11:23.246231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.609478Z","title":"in the wild","venue":null,"work_id":"5c82a57a-143c-484c-8af9-84e2ebc4ca74","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.845000Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:12264c3020e63e69f78ef2afbc14de6d284590fe79cd61fcacb49a7b26172062","observation_id":"6711909a-2893-4e8e-b1cd-699a3ee982eb","resolution":{"observed_at":"2026-08-06T19:11:23.611809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.602220Z","title":"Action-aware masking network with group-based attention for temporal action localization","venue":null,"work_id":"41a0df8b-bf08-48fc-8f46-d02ed87b10f8","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.885940Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a3a2325c43072057ecf7595ac9a5013029fb9f9da2bed80f368ac7020a812221","observation_id":"4dd352be-2111-4088-a5b9-6d6783af75d8","resolution":{"observed_at":"2026-08-06T19:11:23.604772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.594575Z","title":"Neighbor-guided pseudo-label generation and refinement for single-frame supervised temporal action localization","venue":null,"work_id":"d912aaf2-7fae-4f04-be65-5a1278d9c2d4","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.927948Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9e0fcf0c6fac94c853a3bcc3a8b98e5216ae9910573664d1441526b1148b1939","observation_id":"4c19e4c0-3d27-4554-a5e3-699b31c7fa22","resolution":{"observed_at":"2026-08-06T19:11:23.597128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.587498Z","title":"Detal: open-vocabulary temporal action localization with decoupled networks","venue":null,"work_id":"047a3619-defc-4280-925e-8c5227f6c8c4","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.985536Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6bbf4557eb8da64b0c3aa614f87d6e83dae52cfd39bc21d5bb6ecbff8826b47b","observation_id":"6fb3f299-0c4e-49a4-b48c-595d13dd8ab0","resolution":{"observed_at":"2026-08-06T19:11:23.590044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.579514Z","title":"Learning salient boundary feature for anchor-free temporal action localization","venue":null,"work_id":"b16ad834-d84d-41d5-8b3e-dee49a4dc193","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:22.995657Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:c3a3873db70e8e9d52cddd7a5f878d99041650d1ac2d04c40f7387d2944be53c","observation_id":"859dc22b-f09f-4787-8780-e2357b58487b","resolution":{"observed_at":"2026-08-06T19:11:23.582813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.571916Z","title":"Single shot temporal action detection","venue":null,"work_id":"785f6853-cb1c-4878-8e92-029c3fe021a4","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.002110Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:eaed3e27575d98063c046df52eb623f33475f72367f49fa314f4c0820c431ff9","observation_id":"ca82a19b-7fbf-434a-9187-3f2e604a1885","resolution":{"observed_at":"2026-08-06T19:11:23.574750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.564399Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"bc01bd00-31a5-448a-8738-526aac056aa0","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.008857Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ce8f4655ad0edbd564a92daf3029d99bb4af6fa574651bc55ac773b0d28d3701","observation_id":"95afcfe7-074f-4ccf-b11c-4765061e1b51","resolution":{"observed_at":"2026-08-06T19:11:23.567051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.556877Z","title":"Bmn: Boundary-matching network for temporal action proposal generation","venue":null,"work_id":"ca0e70bf-8379-4acf-b0f3-aa11669e3183","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.016258Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b1ca4aeb9c81390777915e6e09a021cd8fdfd5fba2a4ca2d21f7606dda06628c","observation_id":"de3e779b-8009-4128-b12e-32670a8100bf","resolution":{"observed_at":"2026-08-06T19:11:23.559452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17792","last_updated":"2024-07-26T01:16:07Z","snapshot_observed_at":"2026-07-06T18:51:41.167282Z","submitted_at":"2024-07-25T06:03:02Z","title":"Harnessing Temporal Causality for Advanced Temporal Action Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17792","snapshot_observed_at":"2026-08-06T19:11:23.021340Z","title":"Harnessing temporal causality for advanced temporal action detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.021340Z"},"links":{"cited_paper":"/paper/2407.17792","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9ebbb2eb81925dc4c6c95d2a3af4150c750cc0c5a0e0af679abcb93a62f38e6c","observation_id":"e6973668-f611-4570-be4e-a22b16f01c0a","resolution":{"observed_at":"2026-08-06T19:11:23.021340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.548793Z","title":"End-to-end temporal action detection with 1b parameters across 1000 frames","venue":null,"work_id":"dd7815aa-f311-44cf-b9ef-b2ed02d4a340","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.027800Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:c4cc4d30732c7290837c1ebc755d22bde91293beaa2d2700d95549c387a1e591","observation_id":"0c8b3da9-f5bb-4c1b-8fca-af46187bce2e","resolution":{"observed_at":"2026-08-06T19:11:23.551339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.541393Z","title":"End-to-end temporal action detection with transformer","venue":null,"work_id":"796f3541-9826-4e0f-84cb-ec2ae00fe9a6","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.031999Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:4bcc6d4f7aa2f2d104ac585491e6a6fe8b5c34d29ed888211ab67ada976bff69","observation_id":"7a8f4e84-fc8e-45bc-b238-3e666bbf8ae2","resolution":{"observed_at":"2026-08-06T19:11:23.543891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.534338Z","title":"Video swin transformer","venue":null,"work_id":"29bd75dd-3f79-4b90-a3eb-b3b1dff9e33b","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.034463Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7762fca28d360b055d5c65d098c7ad9b0de6ee9a6a94c4a32d8d662904473d2b","observation_id":"3284d5ba-1d59-45d3-9d8a-132cc6c0109a","resolution":{"observed_at":"2026-08-06T19:11:23.536661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.527076Z","title":"Gaussian temporal awareness networks for action localization","venue":null,"work_id":"b1f5bf6f-ab66-4638-abde-3c008c6c3286","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.039044Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:e08db401055edc99286abacd08138169ab692aa4156894017694bf969ad65d46","observation_id":"5c719a37-5f5f-42e4-8ce3-9025928bdd05","resolution":{"observed_at":"2026-08-06T19:11:23.529622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.519502Z","title":"Enhancing temporal action localization in an end-to-end network through estimation error incorporation","venue":null,"work_id":"3ea0e310-409e-40b8-92e0-e1123610d0e1","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.046980Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:34469a522c472aa97ae6ec31adb8903f5c43f440bfd214eaf3609b134a47bd7d","observation_id":"0d463549-f33c-4d39-96bc-ae19eda9a1a0","resolution":{"observed_at":"2026-08-06T19:11:23.522149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.511372Z","title":"Srfnet: selective receptive field network for human pose estimation","venue":null,"work_id":"35f7b629-f953-474f-a1fa-075bdb25936a","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.049789Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:8a62adeeb177624301e4d4567fab5e5d699b229906a841fa560d325a021d3bb4","observation_id":"bbef79e8-014e-4218-80f5-5a7984048065","resolution":{"observed_at":"2026-08-06T19:11:23.514061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.503724Z","title":"Temporal context aggregation network for temporal action proposal refinement","venue":null,"work_id":"75ef2cfe-7b17-44c4-82c3-a7b258dfa9b3","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.053564Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5ca25c00d14b17bdd043340f099c0e83a8693a34fef15bd06ce587b310760680","observation_id":"efcbffab-40ec-49ce-a1ae-d3970240d499","resolution":{"observed_at":"2026-08-06T19:11:23.506362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.496457Z","title":"Action sensitivity learning for temporal action localization","venue":null,"work_id":"fed6fe25-1865-44f2-8a2a-9f92152ba2e5","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.056671Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ee74ec4de1f6106bb9d0b8d622f57ada0970e9f95428efe86d92f050760b62dc","observation_id":"22bce5a9-0c6e-4c58-9dd8-580b5927aefe","resolution":{"observed_at":"2026-08-06T19:11:23.498985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.488747Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"857f71ec-6885-4319-ba70-a4bd5ffb1a50","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.059972Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:41236c2191d9c32a300032066e52eedc5e2cdbc85f9355c7704cfe48882e0b25","observation_id":"5c0dfac6-2d64-4d58-934c-3357115886fb","resolution":{"observed_at":"2026-08-06T19:11:23.491370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.480579Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"1d0dcdf9-1df2-450d-82aa-0ad990b502eb","year":2016},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.062643Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:274c9fde022d39ccfe376773a6a4778a5b78996fa98aed3b7985471cc06263fb","observation_id":"78417488-ee44-4a23-81ee-d9b17cab55b5","resolution":{"observed_at":"2026-08-06T19:11:23.483508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.472204Z","title":"Cdc: Convolutional-de-convolutional networks for precise temporal action localization in untrimmed videos","venue":null,"work_id":"3bb0fd72-f915-4e3d-abc6-9b960350dc15","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.065493Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:33de128c1b07bda1b8188f58cb3fd41ffa672625ea165f404f4a480da088e452","observation_id":"e9e7f9d9-ff23-44d9-a000-b20761680ec0","resolution":{"observed_at":"2026-08-06T19:11:23.474864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.463962Z","title":"Bsn++: Complementary boundary regressor with scale-balanced relation modeling for temporal action proposal generation","venue":null,"work_id":"57fc40f1-8bea-4ab2-ab59-11b1774d255f","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.069889Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:1c05ba77535b93b611b4434d2d2823d84046aefe3652fc4d75164a7ef9ac9a65","observation_id":"2b82db44-5300-4a38-8c26-e0b5024e6417","resolution":{"observed_at":"2026-08-06T19:11:23.466724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.456293Z","title":"Pcg-tal: Progressive cross-granularity cooperation for temporal action localization","venue":null,"work_id":"76478406-5504-401f-96b0-866b8c4b9a8c","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.076577Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b93ae157949fa19f692cc3287dc82e5172a85af6392c7bd57161366cf94b9855","observation_id":"d016328b-9815-42a7-8e47-6f86ce01b886","resolution":{"observed_at":"2026-08-06T19:11:23.458945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.448676Z","title":"Relaxed transformer decoders for direct action proposal generation","venue":null,"work_id":"e3c8ad73-600f-4490-9179-fea0de9851d7","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.079312Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:23be0271d91a90508c69df377a9279ef2086e3f2c15b3ad7ffc4997a8cb9b9f8","observation_id":"7f8b5e62-c450-4f27-99da-de03b14fe008","resolution":{"observed_at":"2026-08-06T19:11:23.451250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.440905Z","title":"Learnable feature augmentation framework for temporal action localization","venue":null,"work_id":"8f95d90c-e542-478d-af84-8916ef72e6b2","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.082217Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:1608730ed5a65b24f90b58481155a8867dfd1e33f8c170fcecfe5ee23d6532ba","observation_id":"7bdc6940-f170-476e-bb43-3beb2f367d2c","resolution":{"observed_at":"2026-08-06T19:11:23.443523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.084608Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.084608Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5736d194a9f8af63585b234a196c6140549069e12a20f63f806b4b3257605236","observation_id":"858549a1-5c71-4a3d-9a5b-9b4345373b48","resolution":{"observed_at":"2026-08-06T19:11:23.084608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.427983Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"0c3ea613-1da7-4110-925f-884b7c40e674","year":2018},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.087383Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f45e92bcccd8360f8d5af068a11421f169421208d79b6e098d4c83082e0c9f10","observation_id":"9acc4167-d534-4981-91de-1a539a0ca6c8","resolution":{"observed_at":"2026-08-06T19:11:23.430511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.089697Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.089697Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9905e9ca90a1edb9d690a21937b69b42937039551d19df36dccdeb1672ef678c","observation_id":"16d6cb2b-4559-4e9e-9014-407f9cf09e9c","resolution":{"observed_at":"2026-08-06T19:11:23.089697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.415409Z","title":"Exploring sub-action granularity for weakly supervised temporal action localization","venue":null,"work_id":"4238135a-1714-44a9-ad81-fdba8bd13779","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.092878Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:18df67560f47593f142a056063b1104f16a0274b2c3938a6b045f8646f25b6f2","observation_id":"50ff45a8-d77b-4c7e-9734-6a861669c79f","resolution":{"observed_at":"2026-08-06T19:11:23.418380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.408147Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":"cbaef1b4-af12-4d71-bbe6-a2a986824147","year":2016},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.095593Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:691e4350b4b5ef326746de27e802e45231177314b8ccbe69b240e502a2e3ff51","observation_id":"027be6b3-5c5c-43c8-95c5-69f70c04405b","resolution":{"observed_at":"2026-08-06T19:11:23.410584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12043","last_updated":"2021-05-25T16:22:12Z","snapshot_observed_at":"2026-07-06T11:12:38.080301Z","submitted_at":"2021-05-25T16:22:12Z","title":"Temporal Action Proposal Generation with Transformers","version":1},"cited_work":{"arxiv_id":"2105.12043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.12043","snapshot_observed_at":"2026-08-06T19:11:23.223111Z","title":"Temporal Action Proposal Generation with Transformers","venue":"cs.CV","work_id":"f389d30c-9ee6-4fee-88a2-7a1e6e7e9eba","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.098006Z"},"links":{"cited_paper":"/paper/2105.12043","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:bda7bf64417ab520ad61d70de38d599c4abf8cc47762adc6e4b0eaac2f5df81b","observation_id":"cfa96287-2dcb-43c1-9667-79baaefe5edc","resolution":{"observed_at":"2026-08-06T19:11:23.225903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.399936Z","title":"Rcl: Recurrent continuous localization for temporal action detection","venue":null,"work_id":"b2fbcb43-b42f-4ebb-8d99-d21269316c43","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.101415Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:7575df67d151f7c674229f299df868740d8db1589b95adec156e74b7169840f4","observation_id":"3806fb40-c5fd-4884-b8af-6ef89d5d4514","resolution":{"observed_at":"2026-08-06T19:11:23.402853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.392226Z","title":"Ensemble prototype network for weakly supervised temporal action localization","venue":null,"work_id":"1b33bdce-f2a4-4345-ad5e-8d5243c01934","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.103962Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:367e7ead5afa3bf4fed6eeebe4d3b0fb181452a716fda6a5e70ec5ac3bba9f39","observation_id":"1bea4208-f818-4f0c-a66c-f510fc042df8","resolution":{"observed_at":"2026-08-06T19:11:23.395056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.02716","last_updated":"2017-03-08T05:52:52Z","snapshot_observed_at":"2026-08-04T04:43:42.241842Z","submitted_at":"2017-03-08T05:52:52Z","title":"A Pursuit of Temporal Accuracy in General Activity Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.02716","snapshot_observed_at":"2026-08-06T19:11:23.106652Z","title":"A pursuit of temporal accuracy in general activity detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.106652Z"},"links":{"cited_paper":"/paper/1703.02716","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:47ffda692e14878976f71f131d455b964d35beeec217bb5dd8076ac4db5cd600","observation_id":"d4e5b11e-cf3b-40fa-8ff8-b8ffd0863552","resolution":{"observed_at":"2026-08-06T19:11:23.106652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.384982Z","title":"R-c3d: Region convolutional 3d network for temporal activity detection","venue":null,"work_id":"665fab3c-05a8-4ac7-a4c9-886583fce8c5","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.111408Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:bfa15251103bff87dbace67640daa1bed51917e755b4ee09e7c5c24a42c52dc9","observation_id":"14a0ab13-3763-454b-9cbe-24ff7a5acbd9","resolution":{"observed_at":"2026-08-06T19:11:23.387447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.377151Z","title":"G-tad: Sub-graph localization for temporal action detection","venue":null,"work_id":"6563f955-361b-4f83-8f54-128b9ccc77f6","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.114526Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:58aaf147a56513774c6224af8dbff1edda9675e03bdeceb55cf6787cb8d535cb","observation_id":"a266ec98-4d92-4972-90a1-d411ced56ead","resolution":{"observed_at":"2026-08-06T19:11:23.379845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.369930Z","title":"Revisiting anchor mechanisms for temporal action localization","venue":null,"work_id":"ad82b2a1-0d2c-4e36-b1fa-da71d44cd475","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.117244Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:10c33c7032227f4d9ef6076bd0bc0ab52b7b13f59f7cb7222e23595630d0f465","observation_id":"5363e2b6-dce5-4db8-98f1-1a2e0c3b66bf","resolution":{"observed_at":"2026-08-06T19:11:23.372488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01897","last_updated":"2024-04-15T07:15:43Z","snapshot_observed_at":"2026-08-03T18:42:03.776803Z","submitted_at":"2023-12-04T13:51:16Z","title":"Adapting Short-Term Transformers for Action Detection in Untrimmed Videos","version":2},"cited_work":{"arxiv_id":"2312.01897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01897","snapshot_observed_at":"2026-08-06T19:11:23.203715Z","title":"Adapting Short-Term Transformers for Action Detection in Untrimmed Videos","venue":"cs.CV","work_id":"e62a687a-d736-40bf-a322-492af26bcd81","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.119629Z"},"links":{"cited_paper":"/paper/2312.01897","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:ccf035cdf6d12c4d787a039c96b9c0d517de6a18a0052c9791103b73f4eb7693","observation_id":"7a454aa4-3a9d-4527-bacb-79dd626db746","resolution":{"observed_at":"2026-08-06T19:11:23.206926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.362310Z","title":"Weakly-supervised temporal action localization by inferring salient snippet-feature","venue":null,"work_id":"c5230cb8-17ea-4525-b773-56ff729be95d","year":2024},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.123013Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:cbc92fcf69dc8a2c3a53dc81173c6b725db7bce94c23a0d83ddad885b35878b2","observation_id":"9adfb4af-1fc8-4048-b214-646f7359f40d","resolution":{"observed_at":"2026-08-06T19:11:23.365071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.354565Z","title":"Graph convolutional networks for temporal action localization","venue":null,"work_id":"ef40c73d-d5ad-4357-be06-efe7f7b2ceec","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.126263Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5d670e0edbb0a711938a2386685248a66afedc692a03520584c59e507719682c","observation_id":"30aaaa02-290a-4c04-a542-4bc60a826111","resolution":{"observed_at":"2026-08-06T19:11:23.357105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.346955Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"76d735e6-38b7-42dd-b3c5-0bdea1835424","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.128663Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:6e536c08f695b1a9ed72c1db376d50f27223c2acd78c41afbbdee7371536c145","observation_id":"ccabff4a-7999-4737-a2d0-c1ff4ebdb7a9","resolution":{"observed_at":"2026-08-06T19:11:23.349484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.339044Z","title":"Towards efficient use of multi-scale features in transformer-based object detectors","venue":null,"work_id":"a5a51c16-7ab5-41b7-96ce-f5c2a6bd872b","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.131608Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:e4a094d5ccfa5c899eafcd1519e6c02212b69eba54052797331c4a377c8aa6ce","observation_id":"99b19b59-cbea-4e72-8454-9a038769bd6c","resolution":{"observed_at":"2026-08-06T19:11:23.341654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03612","last_updated":"2019-12-08T04:16:28Z","snapshot_observed_at":"2026-08-04T20:48:36.044736Z","submitted_at":"2019-12-08T04:16:28Z","title":"Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization","version":1},"cited_work":{"arxiv_id":"1912.03612","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.03612","snapshot_observed_at":"2026-08-06T19:11:23.189985Z","title":"Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization","venue":"cs.CV","work_id":"7b00aaca-45db-4193-a106-966cb2da9f41","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.134539Z"},"links":{"cited_paper":"/paper/1912.03612","citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:0aff9545e1088969195696098ec400b5a9dc168217d9fae919814c1b345dc37b","observation_id":"d5ceeb7a-0860-47e1-9a4d-4d2f0834d476","resolution":{"observed_at":"2026-08-06T19:11:23.194866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.331369Z","title":"Video self-stitching graph network for temporal action localization","venue":null,"work_id":"0d211fc5-25de-4349-b7bd-dea7d2166c1d","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.137556Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:3c82f67b1fa0f7d3aee53c241b634372b7dd8ef196cdd7e0e0e49649bdbce884","observation_id":"76637a1c-2178-43d0-b678-7ff9f19b03df","resolution":{"observed_at":"2026-08-06T19:11:23.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.323201Z","title":"Re2tal: Rewiring pretrained video backbones for reversible temporal action localization","venue":null,"work_id":"b940afd5-c9f5-467c-b494-db6d2f5b9238","year":2023},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.140925Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:cc07a5c257b508fd96e0411e9dc5a3c3baf6010f9f4af8ce9b53f710943d26cf","observation_id":"b71aaf3b-cb14-4eb0-a3c5-d33492c011b2","resolution":{"observed_at":"2026-08-06T19:11:23.326010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.314109Z","title":"Hacs: Human action clips and segments dataset for recognition and temporal localization","venue":null,"work_id":"82810e76-4097-4de1-86bf-ae76f799ca2a","year":2019},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.144070Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:fafb838565ea153379eacc85be675301a114cdcf15081cf0ba4146593aaed568","observation_id":"b5f89cef-246a-45fe-85fb-1314210c6e63","resolution":{"observed_at":"2026-08-06T19:11:23.316905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.305256Z","title":"Tuber: Tubelet transformer for video action detection","venue":null,"work_id":"a60c0480-6fb1-465e-a424-07368d7ea682","year":2022},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.147046Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:f30844c2b1b999476cd8697eaa5e1a459344f413c5c40e250c9c461e6b18dfa2","observation_id":"5d3cc7f5-e12c-4d98-9e31-30b8e2f498f8","resolution":{"observed_at":"2026-08-06T19:11:23.307891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.296698Z","title":"Bottom-up temporal action localization with mutual regularization","venue":null,"work_id":"d956f1ab-0596-4a39-86fd-ee7f7bcd3077","year":2020},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.149702Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:5b8183f5d7e814bfa885c8bde1e363f1e76a7b251d5a13194109b69960aea338","observation_id":"d498284c-9bc4-42ef-b8e2-11d565bbbf2c","resolution":{"observed_at":"2026-08-06T19:11:23.299813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.287553Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"c436dfa2-b692-4873-880d-1d9888c6b5f5","year":2017},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.152873Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:30d28ee1997f8c0adb2ff5610bcf134aec55c63806e6326d6d3b6857e3c6e4e3","observation_id":"8ae7598e-f88e-453f-810a-8bd5706f0d77","resolution":{"observed_at":"2026-08-06T19:11:23.290518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.279374Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"428cb79a-4524-434f-884d-857adc527531","year":2021},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.155707Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:aa7425582ced2ba8342e3df629d4df44dade0ac8ea49e4b8060ce3f33bafef95","observation_id":"2a3147cc-1ef8-4eae-bc18-228112313a21","resolution":{"observed_at":"2026-08-06T19:11:23.282056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.158293Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.158293Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:a18bf6ae1e72c267ed0d1d5c681049a03f1e895daefdcd70c1d6bc326cdaf0b1","observation_id":"414911b9-f501-48a4-aec9-83ce202b5cb1","resolution":{"observed_at":"2026-08-06T19:11:23.158293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.161431Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.161431Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:9b63e742dd5971b43ffe5cbafedb0a85bcf0f38b8615501fb9ab86972d1949d0","observation_id":"b3701c90-62ec-4afa-8f36-21f7e85dcb25","resolution":{"observed_at":"2026-08-06T19:11:23.161431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.164460Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.164460Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:b0fd30f1048657276bd24b37f4039496092c902ec5c57df27bc211ce666c2695","observation_id":"688d7bf8-5255-4615-8228-bac1635c51c1","resolution":{"observed_at":"2026-08-06T19:11:23.164460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:11:23.167054Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T19:11:23.167054Z"},"links":{"citing_paper":"/paper/2507.06411"},"observation_digest":"sha256:525c9012af72f225a09f0555a3a608b5f4854cdb0ba0543cbdddacd38e7e3b4d","observation_id":"b4dc0094-f7f7-4bb3-bcdc-b1d3866aead0","resolution":{"observed_at":"2026-08-06T19:11:23.167054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06411","last_updated":"2025-07-18T14:29:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:03:02.548319Z","submitted_at":"2025-07-08T21:28:16Z","title":"Hierarchical Multi-Stage Transformer Architecture for Context-Aware Temporal Action Localization"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":4,"verified_fuzzy":54},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2507.06411."}