{"as_of":"2026-08-16T19:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd762aa31f27e6fb51a85be1b5b0f509dfd95e8a4e2506377c19600f71c74871","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:50:42.989712Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:50:42.855390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T11:50:43.076165Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"cited_work":{"arxiv_id":"1908.08178","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.08178","snapshot_observed_at":"2026-08-14T11:50:43.076165Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","venue":"cs.CV","work_id":"9d055309-46fb-4e1e-9963-9a4cbc85a21b","year":2019},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.855390Z"},"links":{"cited_paper":"/paper/1908.08178","citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:4f2ad3ff74b0bc83972d102ec6748e69a6e04bd0d7851ded7ac402aa8e757ae1","observation_id":"7f339d31-0b9c-4b70-a6a8-b61ed13f9dfd","resolution":{"observed_at":"2026-08-14T11:50:43.082024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.08178/citation-record","integrity":"/paper/1908.08178/integrity","json":"/paper/1908.08178/citation-record.json","paper":"/paper/1908.08178"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"cited_work":{"arxiv_id":"1908.08178","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.08178","snapshot_observed_at":"2026-08-14T11:50:43.076165Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","venue":"cs.CV","work_id":"9d055309-46fb-4e1e-9963-9a4cbc85a21b","year":2019},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.855390Z"},"links":{"cited_paper":"/paper/1908.08178","citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:4f2ad3ff74b0bc83972d102ec6748e69a6e04bd0d7851ded7ac402aa8e757ae1","observation_id":"7f339d31-0b9c-4b70-a6a8-b61ed13f9dfd","resolution":{"observed_at":"2026-08-14T11:50:43.082024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.452722Z","title":"Gkioxari and Ma- lik [9] applied a two-stream R-CNN based framework to pro- duce frame level detections, and then linked the result to tubes with a dynamic programming method","venue":null,"work_id":"cd6d854c-897a-417a-b0e5-0e3b82622e88","year":null},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.861572Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:edd4283f5bd13af33c028ce43619d7cbd2c4e28a7229667d88138d401d755912","observation_id":"c7d9a6ae-e118-44ad-9eea-78cc5f741af0","resolution":{"observed_at":"2026-08-14T11:50:43.457697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.437316Z","title":"The architecture of our model is il- lustrated in Fig.1","venue":null,"work_id":"e4df999e-0559-40a2-9d29-ecad61db3063","year":null},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.867343Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:4c7836aa7bd19555b301812e9a682c219e5574b59e5506f70ff095475134e488","observation_id":"82e8c3f4-3cef-4500-8f84-b7f8a76438f0","resolution":{"observed_at":"2026-08-14T11:50:43.442577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.421354Z","title":"2: Details of the inﬂated 3D backbone","venue":null,"work_id":"b49447ae-2287-4603-98d1-8f919706d921","year":null},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.873419Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:ce134f105dd945af904dfd3d078d99a921f3cc31c183cbfe249173cc0729cfba","observation_id":"e19187b5-90b2-4b4d-89dc-937324482e09","resolution":{"observed_at":"2026-08-14T11:50:43.426904Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.406116Z","title":"We present an empirical study of the properties of the combinations of 2D RGB, 2D OF, 3D RGB and 3D OF streams","venue":null,"work_id":"e807666d-fe15-43a8-bf6d-032e14b887d6","year":null},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.879378Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:e67d3d982aa86d7ad6e9b6c3c77a9f52a81efe17a31d5339c43d7784a69ca720","observation_id":"97529f97-8c27-43c5-9806-d19e287aa78b","resolution":{"observed_at":"2026-08-14T11:50:43.411596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-15T13:34:03.745436Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-14T11:50:42.885338Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.885338Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:bafcbc2919e8d24560e1da06560d3b4a2357e71f70830f3d5aefe5273380bec5","observation_id":"8f9394d8-490f-4ed3-9175-cdea70bbfbc5","resolution":{"observed_at":"2026-08-14T11:50:42.885338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.390886Z","title":"Two-stream convo- lutional networks for action recognition in videos,","venue":null,"work_id":"8e886562-ac85-4e48-a1d7-7cc55007e3b5","year":2014},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.891186Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:4581482e45a5d7559a16366bc73f8c62ec8d32cab153b2288c8bab7ba0b8ff97","observation_id":"431132e3-a58e-453d-80d7-4174ebb113f1","resolution":{"observed_at":"2026-08-14T11:50:43.395910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.375888Z","title":"Action recognition with im- proved trajectories,","venue":null,"work_id":"e7519765-9ef4-459a-a62b-b342ed366fd7","year":2013},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.896623Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:25812f6fccd7344cab73541cc8c2edf6b64b339a6cddcd119bff84102ef651cb","observation_id":"9e573844-235c-4b9e-8841-235b3e286486","resolution":{"observed_at":"2026-08-14T11:50:43.380433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.359973Z","title":"Learn- ing to track for spatio-temporal action localization,","venue":null,"work_id":"8440f09e-6a7d-455a-89cb-fe117f91be8f","year":2015},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.901635Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:7d429aa9c499b9a33a627ba0cfcfd8647a8f21deb18e47b9f2b91eb18d21ec1d","observation_id":"b20aa00e-ab3c-482d-8253-8c061ddfcb0b","resolution":{"observed_at":"2026-08-14T11:50:43.365142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.343841Z","title":"Large-scale video classiﬁca- tion with convolutional neural networks,","venue":null,"work_id":"d44280b2-a8c9-4ecf-abbc-674de4d3813c","year":2014},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.907563Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:9781574a647e5ddfd8cf5573b947ca664592452cbb77b57aa48685fccd5ceb48","observation_id":"11725eea-9a14-49e7-bc2c-476f87091d3f","resolution":{"observed_at":"2026-08-14T11:50:43.349373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.328165Z","title":"Quo vadis, action recog- nition? a new model and the kinetics dataset,","venue":null,"work_id":"898f70c4-62b0-4496-83c5-63d982bfb786","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.913561Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:edd522a74a08505f7b979087280aab6c8efb204fbb6d44566657eba5e73c7e83","observation_id":"53f96ada-578b-4389-85e3-dbd3583a3a00","resolution":{"observed_at":"2026-08-14T11:50:43.333143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.312702Z","title":"Learning spatio-temporal representation with pseudo-3d residual networks,","venue":null,"work_id":"cad8fccb-d1dc-49ae-89ea-f7d54a8a4d00","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.918664Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:c629c8672a28cc41c77094e8136cd7275cf195513ca16e8469fade3233e8866d","observation_id":"faa873e8-79db-4131-be09-10990bcc7b35","resolution":{"observed_at":"2026-08-14T11:50:43.317624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.293954Z","title":"Multi-region two-stream R- CNN for action detection,","venue":null,"work_id":"22e0d4f0-1231-4bd6-b05a-f77221c1cb4c","year":2016},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.923921Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:a21d55c4925474eafc0527b91a735ab28bf4f03e0c96661f1f68d170927c5ba1","observation_id":"0dccd7ae-304d-4e8e-9149-200c6ea414c7","resolution":{"observed_at":"2026-08-14T11:50:43.300946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.279115Z","title":"Finding action tubes,","venue":null,"work_id":"2ad91d48-c982-4cad-aef4-014fb975cb4d","year":2015},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.929759Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:414b302f734045e526466bdd695eda89657e3660cb735188b6ddea14e87df8d4","observation_id":"0ec2d0d8-4046-421b-94d6-edc2a1423658","resolution":{"observed_at":"2026-08-14T11:50:43.283670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.264200Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual ac- tions,","venue":null,"work_id":"2a511db1-91b8-4cb4-9a01-aad2f5f2daa2","year":2018},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.935895Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:085635d8340194ba8cb28fde9db9bcfae1dec57fe289b40df47b02ccb3a5f076","observation_id":"c0ecfa7b-3661-4173-9ed9-a0e869441d4f","resolution":{"observed_at":"2026-08-14T11:50:43.269414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.247549Z","title":"Deep learning for detecting multiple space-time action tubes in videos,","venue":null,"work_id":"88fa07e2-a0da-409d-8486-a37b16c107ac","year":2016},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.941526Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:2fc0f7b1f63dc57189955ecf9282ea7fa1d5504488034c94c240245be72b47e7","observation_id":"57c0c62d-f275-47de-b9cb-432192ed7d2c","resolution":{"observed_at":"2026-08-14T11:50:43.252616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.231963Z","title":"Online real-time multiple spatiotemporal action localisation and prediction,","venue":null,"work_id":"aa4c4cab-e972-4b64-a9f3-229ac3703de0","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.945989Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:4744ebca0417f768c2242f9048d122690403d0ed1985d02e30868120eacf9c23","observation_id":"515dbe42-d447-4807-8704-9f1971942d22","resolution":{"observed_at":"2026-08-14T11:50:43.237343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.215349Z","title":"Action tubelet detector for spatio-temporal action localization,","venue":null,"work_id":"f2ba2cea-80c4-4dd7-9216-1ef987953170","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.951269Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:03777af6ee1a05f68d9b12d07c76877950ddcc5552f1989b9cc25b4b603b5ec9","observation_id":"3f869e18-729a-4796-adbf-f2eb53a952a9","resolution":{"observed_at":"2026-08-14T11:50:43.220683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.199503Z","title":"SSD: single shot multibox de- tector,","venue":null,"work_id":"a345c20d-15a5-46dd-8fa7-31aea246d094","year":2016},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.955930Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:c9803818897644db34bfa7ad3bf43d8b239442dfb3a4e7b54940ad27a9c93297","observation_id":"aef653ec-1b8c-4586-a7ec-99bf3317b9dd","resolution":{"observed_at":"2026-08-14T11:50:43.204606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.183377Z","title":"3d convolutional neural networks for human action recognition,","venue":null,"work_id":"96771277-48f3-4265-8e47-4064da939302","year":2013},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.960506Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:7fa16cc1677e8ef440f63e92a09dfb9801cbe39443719898fda5926cd2acab6b","observation_id":"7bdc8e4a-e9c7-4558-9a22-ea95ea186122","resolution":{"observed_at":"2026-08-14T11:50:43.188145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.164077Z","title":"Learning spatiotemporal features with 3d convolutional networks,","venue":null,"work_id":"58471a51-b144-4307-9c30-5358b4e6da82","year":2015},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.965321Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:51021ed6971a3176b3ae3a4a4fe5a555e117b2de818dcf3be9f8c4edf332f1a6","observation_id":"d881175b-ba57-4a98-b248-6a1cb56e293a","resolution":{"observed_at":"2026-08-14T11:50:43.169698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01111","last_updated":"2017-11-30T19:26:49Z","snapshot_observed_at":"2026-08-14T20:08:11.053546Z","submitted_at":"2017-11-30T19:26:49Z","title":"An End-to-end 3D Convolutional Neural Network for Action Detection and Segmentation in Videos","version":1},"cited_work":{"arxiv_id":"1712.01111","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.01111","snapshot_observed_at":"2026-08-14T11:50:43.033019Z","title":"An End-to-end 3D Convolutional Neural Network for Action Detection and Segmentation in Videos","venue":"cs.CV","work_id":"ed1912fd-ef02-45bd-a655-af1c4e4a5df7","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.969910Z"},"links":{"cited_paper":"/paper/1712.01111","citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:be15d99e5ef4abf1cef0a7133f4eb9e82d5db3893408cac0aebcbb7e017cea48","observation_id":"8a3a3382-0b41-4f16-bb80-e18ce62746b5","resolution":{"observed_at":"2026-08-14T11:50:43.040922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.146707Z","title":"High accuracy optical ﬂow estimation based on a the- ory for warping,","venue":null,"work_id":"15fa6800-d1c1-4fee-b6aa-8824b1ea8b4f","year":2004},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.974493Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:e8e7a0a5f7410f565112431372328d4209589ad8225575d74260e6ed0125e85a","observation_id":"c3a09ad3-f2a0-499d-8994-7ea0da981f92","resolution":{"observed_at":"2026-08-14T11:50:43.152250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.130124Z","title":"Con- volutional two-stream network fusion for video action recognition,","venue":null,"work_id":"6d7e5eb2-e286-4bd3-96e7-24f2855dc12e","year":2016},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.979446Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:68492d51715cfa387d94c7b86775d8eceb268bcf3757d5b0cab7cf4ea457f618","observation_id":"130fa65d-402e-4f9d-9801-0aabb0e4d4aa","resolution":{"observed_at":"2026-08-14T11:50:43.135557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.112384Z","title":"Tube convolutional neural network (t-cnn) for action detection in videos,","venue":null,"work_id":"6cab080a-3406-4220-9590-7c3a54a6eb76","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.984262Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:e5388a3fcf8e01c20df49850f2a24a71e5b38dbd38acaa055db4c5d12581cc04","observation_id":"17401b76-b582-45e8-a2b6-4857fa31179c","resolution":{"observed_at":"2026-08-14T11:50:43.117652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:50:43.094840Z","title":"YOLO9000: better, faster, stronger,","venue":null,"work_id":"5d4ef802-93c9-4ead-a020-3926e9c95ddd","year":2017},"citing_paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:50:42.989712Z"},"links":{"citing_paper":"/paper/1908.08178"},"observation_digest":"sha256:76e26164867be3916d5a08024eec55805af1d2f8fd25062c647f4c29f0896665","observation_id":"9cf89abb-1f1d-45e7-abad-9bd2bbfccf17","resolution":{"observed_at":"2026-08-14T11:50:43.100394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08178","last_updated":"2019-08-22T03:13:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:45:02.566600Z","submitted_at":"2019-08-22T03:13:22Z","title":"Multi-Stream Single Shot Spatial-Temporal Action Detection"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:1908.08178."}