{"as_of":"2026-08-15T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97b799d3c1a16caa98b2a91fa1f71f834f9a203b55c839b844e33c2228f2cd40","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T15:54:43.174890Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.00497/citation-record","integrity":"/paper/1908.00497/integrity","json":"/paper/1908.00497/citation-record.json","paper":"/paper/1908.00497"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.08675","last_updated":"2016-09-27T21:21:49Z","snapshot_observed_at":"2026-08-14T21:37:52.670253Z","submitted_at":"2016-09-27T21:21:49Z","title":"YouTube-8M: A Large-Scale Video Classification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08675","snapshot_observed_at":"2026-08-14T15:54:42.780284Z","title":"Abu-El-Haija, N","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.780284Z"},"links":{"cited_paper":"/paper/1609.08675","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:7379caa58e684e37609788fa6613cc262a50484aa6db2145f709000c38d0c4ed","observation_id":"6751fa46-dd4d-465b-b2ea-b2db1691a816","resolution":{"observed_at":"2026-08-14T15:54:42.780284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T15:54:42.790041Z","title":"Bahdanau, K","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.790041Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:5ebdd98c0d9ea289e309991c13d3b8337bc81c37579c4f2074caaad765a73737","observation_id":"112df327-0b20-46a6-847c-a2e61285a1b9","resolution":{"observed_at":"2026-08-14T15:54:42.790041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:45.121510Z","title":"Carreira and A","venue":null,"work_id":"17142408-6d89-4c9c-9ade-806b4a86e1e0","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.798580Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:be3194ddf57651f2b39f0fb98e25b4ceca4b0e5f085ee7c08612494edf19b39e","observation_id":"4e147af4-8bbc-428e-abb4-fdd667ee98a2","resolution":{"observed_at":"2026-08-14T15:54:45.129328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.07319","last_updated":"2018-04-08T12:00:58Z","snapshot_observed_at":"2026-08-14T20:11:54.628856Z","submitted_at":"2017-11-20T14:36:31Z","title":"Cascaded Pyramid Network for Multi-Person Pose Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.07319","snapshot_observed_at":"2026-08-14T15:54:42.809605Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.809605Z"},"links":{"cited_paper":"/paper/1711.07319","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:6304a96ee5c4c4e750c0609b124aa70ae46a23a591a992c0f29f104349fc55b9","observation_id":"5b1d847e-0b07-42b7-a190-c5ec4221f83a","resolution":{"observed_at":"2026-08-14T15:54:42.809605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T15:54:42.816154Z","title":"Devlin, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.816154Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:38aebee11f18ee2e816bfe4f5dde6c43a00fc768676b6c44885ff6674b10060d","observation_id":"32fa9639-87c6-40dd-9830-95b2eb0e9348","resolution":{"observed_at":"2026-08-14T15:54:42.816154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:45.085611Z","title":null,"venue":null,"work_id":"8bc1de2a-9493-483e-8a5e-18d40f76c297","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.822624Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:0df84ce857699c0dcf1d541d644efdb1b3c61c6ec9b6b2ecae6600a01a4dc1c3","observation_id":"8f3b427a-dc00-4ae1-a192-e90c38c851d8","resolution":{"observed_at":"2026-08-14T15:54:45.095572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:45.045887Z","title":null,"venue":null,"work_id":"187642fe-2857-4d5a-9334-508d752a032b","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.835138Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:8382feb18269e85faab78f1381b6dd70abd22f769626b4de77cc4e59debf272a","observation_id":"8de56226-9cc0-4414-a946-928f4fae1df3","resolution":{"observed_at":"2026-08-14T15:54:45.054945Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02983","last_updated":"2019-04-21T08:10:54Z","snapshot_observed_at":"2026-08-15T02:22:29.717368Z","submitted_at":"2018-09-09T14:48:22Z","title":"Dual Attention Network for Scene Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02983","snapshot_observed_at":"2026-08-14T15:54:42.843474Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.843474Z"},"links":{"cited_paper":"/paper/1809.02983","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:0b5649df9d94a6f5a47f3659bc3a397b08e28cc57b81edaa2c1ff6ff62716fbb","observation_id":"1fc18fad-c2df-4057-90ef-0a405d1c8e04","resolution":{"observed_at":"2026-08-14T15:54:42.843474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:42.856906Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.856906Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:aa1134bbac6da0755377ee0dcad002b4498ee44ea2edb94ebc7dcb938cc49646","observation_id":"8ac39593-b6d6-4b05-9f73-2e263637446a","resolution":{"observed_at":"2026-08-14T15:54:42.856906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:45.006053Z","title":"Huang, Z","venue":null,"work_id":"34575c70-f8b8-426d-bbb2-c244b5b1f7fd","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.863458Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:44885470afb92be69213f861b605fc0c6d1eab2756e85ed06820bccbef6352e5","observation_id":"2b254ecf-fade-4bae-9013-194852c62b63","resolution":{"observed_at":"2026-08-14T15:54:45.013537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.972307Z","title":null,"venue":null,"work_id":"9fe4dd43-0349-4d3d-8433-a87c168944e1","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.873567Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:941e744f68ce92cba75c86a9c62b6092c6ac7588461800abd2d8e9655b821610","observation_id":"41d07411-4341-4f18-98db-aaf55d3a6bac","resolution":{"observed_at":"2026-08-14T15:54:44.978696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.933728Z","title":null,"venue":null,"work_id":"b85900a0-0c8b-4932-aa0c-d177e7c1558d","year":2013},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.881877Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:c70affe4fa64adab625fbb174a1627cf08c35361774048fc894509d3b9e1da80","observation_id":"6477c1bf-a5cb-4d2a-8e5d-40f2bd433503","resolution":{"observed_at":"2026-08-14T15:54:44.949571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.643643Z","title":"Karpathy, G","venue":null,"work_id":"2304c734-ae55-42e8-863a-38e66903d616","year":2014},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.887381Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:6b26658ae541470e628cf2a8d606bfb8826376d978e8fe8113a7002d0bbbd6f4","observation_id":"0cd42a51-013c-4a93-8175-a0e4b110a5b5","resolution":{"observed_at":"2026-08-14T15:54:44.651692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-14T15:54:42.895220Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.895220Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:8e51f19fb8d6c56a69d9c4ce17dc4e62357bbef26e30e5036fabce0576d6a17f","observation_id":"954fad33-f6ee-48bd-b85a-979e1f2c631e","resolution":{"observed_at":"2026-08-14T15:54:42.895220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.613328Z","title":"Krizhevsky, I","venue":null,"work_id":"b6db333a-359b-48b3-8db8-0250e66f5c01","year":2012},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.905690Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:1de912edba069f88d48d4d9441ed499be87a6fc0ca4a19de5049a380a33f5020","observation_id":"c28634c2-5bb4-4bb5-b885-d0a7ab8c229a","resolution":{"observed_at":"2026-08-14T15:54:44.622113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.585604Z","title":"Liu and J","venue":null,"work_id":"4db666fb-b324-4cb7-a63e-56c3e821c167","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.914970Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:bbf9ab47c94e21f29548a500fb82ea53cbbb3dad827f81ce5d0a59ec8ee22899","observation_id":"e72865ef-046e-4b55-8aac-1a0ab4e74218","resolution":{"observed_at":"2026-08-14T15:54:44.592844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.496925Z","title":null,"venue":null,"work_id":"8631938b-cd31-49d7-8053-12774c7ec05f","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.921218Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:4a46d548ff2c067abed4f45dd2937bf4b1b9fc4000d9b9fcd1785e9bf79fd9e8","observation_id":"5325888f-da2f-43c9-98e0-1151f9ede3ec","resolution":{"observed_at":"2026-08-14T15:54:44.512208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.476469Z","title":"Mayer, E","venue":null,"work_id":"53dc6af7-30aa-4ef5-877d-78ae9537d3d7","year":2016},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.927437Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:583c8c09d2bdd6d5789c63de7c2a8d4068eddfbb91bf98e83e11a2a4afe5635f","observation_id":"d03870d3-30de-434e-8ec0-53065e4591b6","resolution":{"observed_at":"2026-08-14T15:54:44.484454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.434039Z","title":null,"venue":null,"work_id":"273ee925-3ee5-4855-89a4-3584f47b4c06","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.935348Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:02b8de47046d7327e6989c7224fd2f4795ed6e08741e64ac032aa1497905e0bc","observation_id":"24fcfc26-551b-4c0a-929f-8c81d752aa5d","resolution":{"observed_at":"2026-08-14T15:54:44.451084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.409685Z","title":null,"venue":null,"work_id":"1d4a3437-12c7-4e07-b0bf-09de8496f2c4","year":2015},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.945667Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:ffb6d89867a7d10a52be4a928ca706c24afbabab88c1a768b271d6cb5129b743","observation_id":"28a8224b-7d12-4289-9371-2197008d72c9","resolution":{"observed_at":"2026-08-14T15:54:44.417324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.375175Z","title":null,"venue":null,"work_id":"49154c9c-2744-472d-9500-e734f6a4fdae","year":2010},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.961254Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:65cf316459014826f109bb0c0c71489e58a16025dd95e22d9202139105e2b8d1","observation_id":"e211a0b4-3eba-4bb6-ac71-dfbbd0d9176c","resolution":{"observed_at":"2026-08-14T15:54:44.388082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.07240","last_updated":"2018-04-11T05:59:52Z","snapshot_observed_at":"2026-08-14T20:11:59.498784Z","submitted_at":"2017-11-20T10:16:33Z","title":"MegDet: A Large Mini-Batch Object Detector","version":4},"cited_work":{"arxiv_id":"1711.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.07240","snapshot_observed_at":"2026-08-14T15:54:43.565714Z","title":"MegDet: A Large Mini-Batch Object Detector","venue":"cs.CV","work_id":"710ba070-1c77-44d2-91dc-769e50858b93","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.976858Z"},"links":{"cited_paper":"/paper/1711.07240","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:d4c30351e9a04a91c98d85bd98fe49f74a1faa9218224d5c86562d4425d7f218","observation_id":"bfd9ff29-bd61-459c-b57d-560a697eea00","resolution":{"observed_at":"2026-08-14T15:54:43.581421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.354449Z","title":null,"venue":null,"work_id":"9d6a4275-7a89-49c3-be2b-5bc84c90dd14","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.983864Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:555abb2bbf94ec72a11b26110937b2e31c1db61afd7feeaab490cd3a900621cb","observation_id":"51deebde-90dc-4944-9e27-a1bb5816ba9f","resolution":{"observed_at":"2026-08-14T15:54:44.360660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.324735Z","title":null,"venue":null,"work_id":"f2027737-6066-4ed3-a4b7-a608e3553dec","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:42.993755Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:17fb0c4874a4c4e5067300b26d0625bdabc6a238d71ac796a3d1170017bc4bdd","observation_id":"3e38d565-1826-474f-93f9-0ad71512bdae","resolution":{"observed_at":"2026-08-14T15:54:44.335140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.295986Z","title":"Russakovsky, J","venue":null,"work_id":"b079cca9-e783-4003-a3ca-2b4025bb1b63","year":2015},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.004165Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:fbd81c328d12494f4f92c379b1c6faccc4bddf4cd2cfae99818bdd60950f30fa","observation_id":"39d0ba60-874b-4f5e-9fdd-4649ab9f5a53","resolution":{"observed_at":"2026-08-14T15:54:44.308063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.08416","last_updated":"2017-12-22T12:16:29Z","snapshot_observed_at":"2026-08-14T20:00:51.754841Z","submitted_at":"2017-12-22T12:16:29Z","title":"On the Integration of Optical Flow and Action Recognition","version":1},"cited_work":{"arxiv_id":"1712.08416","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.08416","snapshot_observed_at":"2026-08-14T15:54:43.492013Z","title":"On the Integration of Optical Flow and Action Recognition","venue":"cs.CV","work_id":"eea2fbc7-7a58-450a-b9ce-7efb5de0cef2","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.014906Z"},"links":{"cited_paper":"/paper/1712.08416","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:dcd4fd0b062281ffa86554a8bf2788d6a5e97a4ca1543cdd647114dd6e5786af","observation_id":"667ee23d-27e5-4a00-ade5-f2a66734d27f","resolution":{"observed_at":"2026-08-14T15:54:43.515161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.04119","last_updated":"2016-02-14T17:20:19Z","snapshot_observed_at":"2026-08-14T22:23:11.925017Z","submitted_at":"2015-11-12T23:06:42Z","title":"Action Recognition using Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.04119","snapshot_observed_at":"2026-08-14T15:54:43.021631Z","title":"Sharma, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.021631Z"},"links":{"cited_paper":"/paper/1511.04119","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:bca994cf99afe7cafdf06264063d647fd821c2778952475865e217d9125e95ff","observation_id":"75106e54-0625-4367-afe5-01fd49dceb2b","resolution":{"observed_at":"2026-08-14T15:54:43.021631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.274296Z","title":"Simonyan and A","venue":null,"work_id":"17fef0aa-871b-4274-818b-7534d83e86ed","year":2014},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.029654Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:2ec5688b13490ca236314fc279be52a2d16baf010bcb55bc5222844c6f53347a","observation_id":"b951d732-0493-4675-9bd0-2afc267e1dd8","resolution":{"observed_at":"2026-08-14T15:54:44.281189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T15:54:43.047515Z","title":"Simonyan and A","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.047515Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:e0178bd245276b64c7367a14a619b13e4c78ec8056bf3fe2a1adec8e756b7086","observation_id":"e3fafc72-fb69-49a2-99d3-edb41d6ebe32","resolution":{"observed_at":"2026-08-14T15:54:43.047515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-13T22:00:40.727122Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-14T15:54:43.053487Z","title":"Soomro, A","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.053487Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:2d0d502c31822a44b56345f619d678c34aeb67d23321fc62382a3b6d7e5a8d14","observation_id":"cbf9c0f1-d194-4822-891f-b762838e4c1c","resolution":{"observed_at":"2026-08-14T15:54:43.053487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.244002Z","title":null,"venue":null,"work_id":"5e457409-17a0-4cb8-96d8-154f8cd4fd0b","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.060336Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:880c42933606f2a080f5c3f0b57c6a1159011ecc8e27292e9a4914df76478932","observation_id":"b991526b-bd40-4ab4-bb70-7c58788d6e25","resolution":{"observed_at":"2026-08-14T15:54:44.252773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.221347Z","title":null,"venue":null,"work_id":"857ae913-24f6-4bb9-be90-e24831923d2d","year":2015},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.071955Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:2ea28f24ad6c1e27392df105c5417e79323829e5513f43869b53abdb359fc519","observation_id":"2776089d-c4b6-4c12-97ec-dff6b5e7b422","resolution":{"observed_at":"2026-08-14T15:54:44.227992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.192636Z","title":null,"venue":null,"work_id":"ba4baa44-2e09-4329-8da0-0dbf36a8a0bb","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.079449Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:2ddc07a5656b6c2557da05663a749c7bbc80cc1a1c211e37df3f5e79847d5c09","observation_id":"a0d67fa4-d5c0-411d-ad1d-45612b81bc07","resolution":{"observed_at":"2026-08-14T15:54:44.199782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.153189Z","title":"Vaswani, N","venue":null,"work_id":"4d51acf7-a7e8-4004-a1da-ee249e641bde","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.087949Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:49f8a423c441081ac099815e854dca643e637ed99f4b032f53f1fed5aee639f8","observation_id":"0b01d6cd-9820-4d54-ab17-6db698a7396d","resolution":{"observed_at":"2026-08-14T15:54:44.163408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.128455Z","title":null,"venue":null,"work_id":"fb7a79c2-2ad4-435e-afcb-8edefa87733c","year":2009},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.095153Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:c82f62cfeff15313db47ab776fc158843de2f6ff6a035a439fe18e9f76ba0580","observation_id":"f89b8223-2ec0-4365-8725-3e2c778d25d0","resolution":{"observed_at":"2026-08-14T15:54:44.136388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.098155Z","title":null,"venue":null,"work_id":"80d8a212-fe2f-4ed7-97b1-63aeb339e0e7","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.101633Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:12abe542dacba3348a21754d900a6441120cadae7ed28ae059b0f039a25b92b5","observation_id":"3b717dc3-3597-4f79-972b-58e0f1cadce2","resolution":{"observed_at":"2026-08-14T15:54:44.109482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.056772Z","title":null,"venue":null,"work_id":"0eea1f30-1f0e-4e60-a406-c2f6ac585f24","year":2016},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.111231Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:52da1771d80d3995a4df36bb02ded3e4ab449c2eea6a76b02918bffff19cee70","observation_id":"e424d0b0-691e-4674-8f87-86eb7aa5542e","resolution":{"observed_at":"2026-08-14T15:54:44.072680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:44.016971Z","title":null,"venue":null,"work_id":"1644fedf-282e-4166-9b65-74de4644466d","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.120978Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:6ccafe4aa4db1a3c8677d9b7794f4db015ca6cb4cef4f84ac29ec0b25e1223b7","observation_id":"b38646b6-e2d0-40a0-b2da-1b1779680033","resolution":{"observed_at":"2026-08-14T15:54:44.025952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:43.975920Z","title":null,"venue":null,"work_id":"bd96152e-33c2-40df-8c76-a140e8c39324","year":2015},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.126313Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:99956985b64403fc358c46488e3f173fba2b62d2069676d4bc83cb8d85642b37","observation_id":"52861015-cc36-4f2e-bb97-a2148ae93e18","resolution":{"observed_at":"2026-08-14T15:54:43.998400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.04851","last_updated":"2018-07-27T03:20:56Z","snapshot_observed_at":"2026-08-14T20:04:01.300988Z","submitted_at":"2017-12-13T16:40:55Z","title":"Rethinking Spatiotemporal Feature Learning: Speed-Accuracy Trade-offs in Video Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.04851","snapshot_observed_at":"2026-08-14T15:54:43.135190Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.135190Z"},"links":{"cited_paper":"/paper/1712.04851","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:c39b8cada2a5969e8bda8a63973dd8fbe1b4d589a81a6dff60e27e65bd9d9fb6","observation_id":"9ee43207-6ad5-4fc3-9816-83ad465b14dd","resolution":{"observed_at":"2026-08-14T15:54:43.135190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:43.938147Z","title":null,"venue":null,"work_id":"fdb0b391-5dc2-4050-b8b7-60284db36920","year":2007},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.146399Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:55ca7be7872078a43e6ac8d6c85d6e1abadb1f2d8d49fc4f086a5bf5bad44530","observation_id":"07d52d1d-39f3-440c-a230-3ed2fe1bfeb4","resolution":{"observed_at":"2026-08-14T15:54:43.945830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08318","last_updated":"2019-06-14T18:20:10Z","snapshot_observed_at":"2026-08-14T19:12:44.872970Z","submitted_at":"2018-05-21T23:10:35Z","title":"Self-Attention Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.08318","snapshot_observed_at":"2026-08-14T15:54:43.155697Z","title":"Zhang, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.155697Z"},"links":{"cited_paper":"/paper/1805.08318","citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:b3d28f7fe3104e2863fd81563bc1743b85e2c3b5c73a19bd5a2be338970e5213","observation_id":"f123e6cd-9e36-446d-822f-2cba98f055c6","resolution":{"observed_at":"2026-08-14T15:54:43.155697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:43.902486Z","title":null,"venue":null,"work_id":"e18bcc30-8426-4278-88e6-95721be4dcb9","year":2017},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.166335Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:ff0bf4e7f62f2b8313bb6a88042d48e900dda37672ba5b8854775b59d8e745dc","observation_id":"0f84bcd4-1086-4009-a5e9-0b668f544f69","resolution":{"observed_at":"2026-08-14T15:54:43.913299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T15:54:43.866983Z","title":"Zolfaghari, K","venue":null,"work_id":"8845b523-5120-46e9-9774-7c3d8ccb2b81","year":2018},"citing_paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T15:54:43.174890Z"},"links":{"citing_paper":"/paper/1908.00497"},"observation_digest":"sha256:2a67080b3484f0f2ceefd8caf61de9ad2d4debbd70215e5667f68c414368aeaa","observation_id":"1d8a218a-62d5-4f68-a959-3f1fea57582b","resolution":{"observed_at":"2026-08-14T15:54:43.873069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.00497","last_updated":"2019-08-01T16:46:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:06:37.970332Z","submitted_at":"2019-08-01T16:46:42Z","title":"Two-Stream Video Classification with Cross-Modality Attention"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:1908.00497."}