{"as_of":"2026-08-16T23:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fcb01fd08d910da699c1946ef36b9a7b899c27bbe257982a94587e896ea627bb","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:50:19.144468Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.20567/citation-record","integrity":"/paper/2506.20567/integrity","json":"/paper/2506.20567/citation-record.json","paper":"/paper/2506.20567"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.832748Z","title":"Dense- captioning events in videos","venue":null,"work_id":"bbcc69d5-aeca-4721-a2b4-ab8ef1954c3d","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:14.947835Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:c76f415088624e855afd31254f5b4f2d7f149d622d0279b64e091b53c316e40f","observation_id":"be343b00-0a56-4c27-848f-04d828ab018d","resolution":{"observed_at":"2026-08-06T22:50:21.836616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.819354Z","title":"Bidirectional attentive fusion with context gating for dense video captioning,","venue":null,"work_id":"6a614688-044b-4580-af3f-9a467956aefd","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:15.138319Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:e6b8d2d2afc979ad9a86ec4e83ac43d3ff8939a4bc9877887c7610a861dc3ecf","observation_id":"33a67473-8759-42cf-8a2a-607f6a88c040","resolution":{"observed_at":"2026-08-06T22:50:21.824027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.806634Z","title":"Jointly localizing and describing events for dense video captioning,","venue":null,"work_id":"265c169d-cd09-4c1d-9886-65c0c92d9420","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:15.506523Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:cb6c070514e99beabed9a6bf8e19747ea3c7880aae44558a25d97071270a0277","observation_id":"2dbc9973-8cec-4bd0-b42f-f5b0aa8e81e4","resolution":{"observed_at":"2026-08-06T22:50:21.810753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.794344Z","title":"End-to-end dense video captioning with masked transformer,","venue":null,"work_id":"d3401c28-503a-41ae-9909-24397cbdcb02","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:15.751479Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:b69d47d4380515426439dfd04d5163cb3d8e5a9cae919d9b670d7d00eb595967","observation_id":"ece2b424-bb17-4a27-8843-0b7c3806da3a","resolution":{"observed_at":"2026-08-06T22:50:21.798297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.781930Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":"5b8222f1-fdd9-45aa-bf5e-6a60839a943e","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:15.821613Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:07c0d11b738de54f00e4264542f31f7fb2eaca7457987ac778fe74fa28ebf5f9","observation_id":"5286d440-f748-4688-a186-0688100c1150","resolution":{"observed_at":"2026-08-06T22:50:21.785815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.769176Z","title":"Automatic annotation of human actions in video,","venue":null,"work_id":"d68854b9-0600-44bc-81be-ee3a01e5b653","year":2009},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:15.928863Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:b08aa501f29d87de099ef791890207e4c0159c7398ad86e2ba0bdd2a3490f9b6","observation_id":"51087b00-fc3d-4d69-8aed-a39609d4b09a","resolution":{"observed_at":"2026-08-06T22:50:21.773304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.756218Z","title":"Fast temporal activity proposals for efficient detection of human actions in untrimmed videos,","venue":null,"work_id":"b153f198-60f8-4ebd-8eba-aaf8b5d0398a","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.027777Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:479373738205070efb524ff397fcbcec5cda0f0536485c70a782adf105e19d99","observation_id":"1f492d7f-d6a3-4b07-96ff-394272b47d28","resolution":{"observed_at":"2026-08-06T22:50:21.760433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.743602Z","title":"Daps: Deep action proposals for action understanding,","venue":null,"work_id":"727701b8-b249-46ce-8be8-4de79c7d8517","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.131829Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:34da34de606c1aafcdca7cca1f037b23eed86a96f76d8f5d7c60a14ac1acd60f","observation_id":"4e2e2220-8af5-4048-bcd9-f6e07f71945a","resolution":{"observed_at":"2026-08-06T22:50:21.747757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.730720Z","title":"Sst: Single-stream temporal action proposals,","venue":null,"work_id":"3aa2e0ec-e48c-4b01-9a76-b172b947cd62","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.205197Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:e23b41263489df6818084a3813b348e4f2c87224b8ac09397bdb2d3ad64664b4","observation_id":"1cb9ebd6-f373-4ab0-9544-2181ac28f2b5","resolution":{"observed_at":"2026-08-06T22:50:21.734681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.717493Z","title":"Weakly supervised dense video captioning,","venue":null,"work_id":"159cd2fc-3d5b-4824-870e-ed2318f5dfbd","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.272610Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:ce5187533b227f3e630fa410bc55da4808288c28a9b5fd21772314472b817584","observation_id":"80efb3de-abc5-4b9f-aeeb-46e29a54dec9","resolution":{"observed_at":"2026-08-06T22:50:21.721776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.703731Z","title":"Jointly modeling embedding and translation to bridge video and language,","venue":null,"work_id":"c735299a-8292-4a51-b720-61dad697331c","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.351104Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:15065c7bc206fe6081ddbff174a12f0c8fa6ab9194139aeb44f5078e749809e7","observation_id":"b111f691-401d-42d8-b482-7d930212da28","resolution":{"observed_at":"2026-08-06T22:50:21.708393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01457","last_updated":"2018-03-05T01:57:49Z","snapshot_observed_at":"2026-08-15T19:01:26.528671Z","submitted_at":"2018-03-05T01:57:49Z","title":"Less Is More: Picking Informative Frames for Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01457","snapshot_observed_at":"2026-08-06T22:50:16.420489Z","title":"Less is more: Picking informative frames for video captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.420489Z"},"links":{"cited_paper":"/paper/1803.01457","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:ee0aeac739097e5d28adf62a62123b47a186860449cb0dbc73050d82432d4b37","observation_id":"34691900-1b4e-4d53-b0ff-4884cf7f6abc","resolution":{"observed_at":"2026-08-06T22:50:16.420489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.690035Z","title":"Video captioning via hierarchical reinforcement learning,","venue":null,"work_id":"9f5e7a5f-ebd6-4af3-969b-7092ca9edc51","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.495187Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:6a53429e75635d563860ba28b7f270ad956ae190276332ae6c4a67a46523ebc1","observation_id":"64a7f426-94ce-4bee-bcdf-c206b3dcb5bc","resolution":{"observed_at":"2026-08-06T22:50:21.694298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.675265Z","title":"Reconstruction network for video captioning,","venue":null,"work_id":"5a7bf191-95fa-4c6d-96cd-273c5e12b07d","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.571296Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:84ade2c32f149c78208b1a7062c35b84cdd9e15db3d821fdb85f7cc0c04a5547","observation_id":"26fb4082-e17d-4b5c-baa5-69bac34be641","resolution":{"observed_at":"2026-08-06T22:50:21.680005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.660593Z","title":"Interpretable video captioning via trajectory structured localization,","venue":null,"work_id":"642b52fc-70a7-4340-ae2b-bdd0de014064","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.644115Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:7a2d49430a7681c7f3058e6f674b64e5a753c11fd08e6591b1b8cb87b26d89a7","observation_id":"9659b044-96d4-4b68-9875-b5f77204ba98","resolution":{"observed_at":"2026-08-06T22:50:21.664698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11439","last_updated":"2018-04-07T01:49:44Z","snapshot_observed_at":"2026-08-14T19:30:43.385978Z","submitted_at":"2018-03-30T13:15:56Z","title":"Regularizing RNNs for Caption Generation by Reconstructing The Past with The Present","version":2},"cited_work":{"arxiv_id":"1803.11439","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.11439","snapshot_observed_at":"2026-08-06T22:50:19.358576Z","title":"Regularizing RNNs for Caption Generation by Reconstructing The Past with The Present","venue":"cs.CV","work_id":"eb56d05d-05fd-4ddf-b4e9-8bd86bd0247e","year":2018},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.710262Z"},"links":{"cited_paper":"/paper/1803.11439","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:cf2e33751abfa84d1f14b3e53eb2a49313c126595f01e190cb30343a5016f543","observation_id":"f29e687c-2cd5-42ab-889c-d2f3c6092f24","resolution":{"observed_at":"2026-08-06T22:50:19.418898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.646915Z","title":"Improving action localization by progressive cross-stream cooperation,","venue":null,"work_id":"95e4fc97-ad9c-462d-8d61-376991a95711","year":2019},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.774200Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:6a2d40a74020a9415acc6b28b90205bef4c8d4156750b14e71404750f0bdfd6c","observation_id":"ce9bf090-d342-4cfb-a08a-a40191860b7b","resolution":{"observed_at":"2026-08-06T22:50:21.651024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.4729","last_updated":"2015-04-30T04:22:06Z","snapshot_observed_at":"2026-08-14T23:07:29.859259Z","submitted_at":"2014-12-15T19:21:50Z","title":"Translating Videos to Natural Language Using Deep Recurrent Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.4729","snapshot_observed_at":"2026-08-06T22:50:16.850678Z","title":"Translating videos to natural language using deep recurrent neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.850678Z"},"links":{"cited_paper":"/paper/1412.4729","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:4d87fd5f8be62e057913cbf54916be04e02f8ee34ada627ac578521bc37741e5","observation_id":"5a5566f1-892b-441a-8b57-612754d6b74f","resolution":{"observed_at":"2026-08-06T22:50:16.850678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.633779Z","title":"Semantic compositional networks for visual captioning,","venue":null,"work_id":"f749c062-58e7-460a-9372-8c854bef1379","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.928322Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:52a5842b5fe52b31db930723e6d4da2ff8e55fc390f14c3fdf253992f2fe7c97","observation_id":"b6da2887-c6d6-46f5-8f61-df3d60d97517","resolution":{"observed_at":"2026-08-06T22:50:21.638022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.620343Z","title":"Describing videos by exploiting temporal structure,","venue":null,"work_id":"0f97617b-f6ae-43a1-bb35-ac6fec1d9456","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:16.993545Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:6102abf52b801ccc56145634ebe284f31ff114bd911b60e1f676ea3f74968955","observation_id":"cba3db13-0d13-4e52-acdb-799695ca3fc8","resolution":{"observed_at":"2026-08-06T22:50:21.624379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.607097Z","title":"Video captioning with transferred semantic attributes,","venue":null,"work_id":"fa6dffb6-de8c-4921-a8d9-6499635cbaa9","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.057222Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:2ddbef00f250280927a610df53b790a4b8cd60020dbca82dd23f1ffbec12bca0","observation_id":"eecebb60-f696-4b9d-8081-c57a3fb3b305","resolution":{"observed_at":"2026-08-06T22:50:21.611453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:17.136369Z","title":"Sequence to sequence learning with neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.136369Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:ca00fe0680774b7fb97bfccf93bf5f164b0b6da595de3e8d4bcdcf8bd6ca711f","observation_id":"47670dd5-f172-4f4a-8a76-f47d67139d96","resolution":{"observed_at":"2026-08-06T22:50:17.136369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.584095Z","title":"Long-term recurrent convolutional IEEE TRANSACTIONS ON XXXX, VOL.XX, NO.XX, XXXX,XXXX 10 networks for visual recognition and description,","venue":null,"work_id":"8dc44d53-1d04-475d-a8eb-f3dfb2f16cc3","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.171573Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:c97e33e41ce9e2046db3ee120138e24001357782bab1d0e8f3beb13ba47dcf69","observation_id":"3fca801c-b22a-427b-9c4a-81463bd9f9ab","resolution":{"observed_at":"2026-08-06T22:50:21.588755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.569656Z","title":"Hierarchical recurrent neural encoder for video representation with application to captioning,","venue":null,"work_id":"5f586e49-f95a-498f-a552-e8dc17e31584","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.278138Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:bec692996bc2da26c59cdf2960ee7cb5c5826ef38b0573db9af0c25fe49e4fa8","observation_id":"9e959d1f-aeee-4df8-a6bb-b2575e7027fd","resolution":{"observed_at":"2026-08-06T22:50:21.574208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.554871Z","title":"Summarization-based video caption via deep neural networks,","venue":null,"work_id":"ec208698-b341-40e5-96cd-e49b19d1f389","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.341956Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:6a4de327c3cc94dace304a2efa1ec0bf4a5da5d13523f57ff922ae80d8a55c62","observation_id":"afdcac9b-cd09-4ae5-b00b-969b5c1147f1","resolution":{"observed_at":"2026-08-06T22:50:21.558868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.541761Z","title":"Boosting video description generation by explicitly translating from frame-level captions,","venue":null,"work_id":"9c8b37ed-e577-47c3-b9f0-9e18cdb5502a","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.443160Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:5c9fc0c6bad0913bc512c20d7f55b510403bab831ea89f71e60bf9d8b5279910","observation_id":"bcfd8f4c-8c67-4854-8a7f-cc145ae2ae7a","resolution":{"observed_at":"2026-08-06T22:50:21.546119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.528248Z","title":"Lexrank: Graph-based lexical centrality as salience in text summarization,","venue":null,"work_id":"adb0ddf7-693b-4722-98cd-1c4e7ae10621","year":2004},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.493254Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:ea131f4a66eadfdfa31dbb3233559a7a9cfde6f50e4025678ac08fea1ee2cefa","observation_id":"153e326f-a6cc-4833-b38a-90984ed248d2","resolution":{"observed_at":"2026-08-06T22:50:21.533177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.458793Z","title":"Ask, attend and answer: Exploring question- guided spatial attention for visual question answering,","venue":null,"work_id":"2ec9b93a-fd70-4012-921d-8db29ff72bad","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.632919Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:a27646d7837b72e488ba5c1a5767a7d79f2b6f068fe4c4de952ec73c7f5bf5e2","observation_id":"5096925b-ce27-4472-80d4-02e4aed4e32e","resolution":{"observed_at":"2026-08-06T22:50:21.519131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.350158Z","title":"An end-to-end spatio- temporal attention model for human action recognition from skeleton data","venue":null,"work_id":"33e73b96-3b1a-4a02-bf67-35e2ef2c7af9","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.727526Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:fb8959799884350201e532b7473d9f30ba2882e570bbe9e9ef5261492eaf407b","observation_id":"9142f11f-c8c5-4c42-bcb5-f0fefa19ec27","resolution":{"observed_at":"2026-08-06T22:50:21.431310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:17.810265Z","title":"Image captioning with semantic attention,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.810265Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:f4267883d1a4a90d33e83d988e45c0565925d12a5dc1ae5e88afbd8ce2496231","observation_id":"c238bbcc-909f-4504-95d2-52234236109a","resolution":{"observed_at":"2026-08-06T22:50:17.810265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:21.130923Z","title":"Stacked attention networks for image question answering,","venue":null,"work_id":"423d1a9b-ca0a-4cde-8478-adfd890b51c6","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.888817Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:1fee959b6dc90aa45fbb65ad1432fa33ac33bedb6fd07b2b34fc5af0c59e961c","observation_id":"67b1e6b7-a537-4a0e-ad74-280516af2d9b","resolution":{"observed_at":"2026-08-06T22:50:21.206292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06904","last_updated":"2017-04-23T10:03:49Z","snapshot_observed_at":"2026-08-14T21:05:21.832997Z","submitted_at":"2017-04-23T10:03:49Z","title":"Residual Attention Network for Image Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06904","snapshot_observed_at":"2026-08-06T22:50:17.952445Z","title":"Residual attention network for image classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:17.952445Z"},"links":{"cited_paper":"/paper/1704.06904","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:c8339e8c57aba15139e77d6220dc8a7f5f9995be7e36c0e7940d93312d51b352","observation_id":"d2a57b90-233d-4438-ba2c-26a090fb6fb9","resolution":{"observed_at":"2026-08-06T22:50:17.952445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7755","last_updated":"2015-04-23T16:49:23Z","snapshot_observed_at":"2026-08-14T23:57:21.557178Z","submitted_at":"2014-12-24T20:58:23Z","title":"Multiple Object Recognition with Visual Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7755","snapshot_observed_at":"2026-08-06T22:50:18.031129Z","title":"Multiple object recognition with visual attention,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.031129Z"},"links":{"cited_paper":"/paper/1412.7755","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:a15cf2637e3351db2f2566f7f9151d801323334d09cf13ab2967b9a320419eb2","observation_id":"f185ee68-2d35-4448-99b7-2ed1a5f56e17","resolution":{"observed_at":"2026-08-06T22:50:18.031129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:18.148720Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.148720Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:52139db0c3f35566bcf5b3db008d17e416fa25c91038788c453207b2535c5ff1","observation_id":"64f901d5-1fc5-4219-bbb6-5cc4ab005fdc","resolution":{"observed_at":"2026-08-06T22:50:18.148720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:18.251741Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.251741Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:c8cc0018215ca1d026f27c5ab4a5684dc8f9f3614e300a5a33c7bd376c627dfb","observation_id":"7acad870-ab6f-4d61-ab92-81cc6614a751","resolution":{"observed_at":"2026-08-06T22:50:18.251741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:20.953896Z","title":"Review networks for caption generation,","venue":null,"work_id":"949ff944-b916-41db-ae3a-576ad7b4147b","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.310504Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:b210f0e0293784e095507d3dbf14d9f449e8c5205df0c0150a29b37eac915fbf","observation_id":"776b54e1-8256-4075-a76c-48aaaea7ddc3","resolution":{"observed_at":"2026-08-06T22:50:21.098629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:20.716362Z","title":"Self- critical sequence training for image captioning,","venue":null,"work_id":"6d789abe-84ff-4e2a-9208-234a0e33ffb3","year":2017},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.416926Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:3b575deb3d3089d84681b5aa08d04e4ab7455cc89de8ebed788d22cfb2ae29e3","observation_id":"a64cea73-d1ab-4008-88cd-dd6170dd4276","resolution":{"observed_at":"2026-08-06T22:50:20.810377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:20.482657Z","title":"Sequence to sequence-video to text,","venue":null,"work_id":"83ea0aa2-b00b-4adb-9aec-d566c379b142","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.523498Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:90bed6f4e1e1ca5459559cd755015877250574d80115f214b2186ef9dec29c48","observation_id":"34981dca-27dd-40ef-b3f7-81a90eee49c4","resolution":{"observed_at":"2026-08-06T22:50:20.599387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:20.289131Z","title":"Video paragraph captioning using hierarchical recurrent neural networks,","venue":null,"work_id":"7de85bfa-bb5c-42ea-a048-294f0d9fed84","year":2016},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.609179Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:be6c506d2c75556ecef29124a3cd402c8e5274ba9d36653f32b6f55e1d7ebddd","observation_id":"7b410b05-f45d-4306-931c-1e325669fc92","resolution":{"observed_at":"2026-08-06T22:50:20.332965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:18.680565Z","title":"Activitynet: A large-scale video benchmark for human activity under- standing,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.680565Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:6cb97619407acca29841e35e88f5a7378ad5016687e3de7292539ad54dcca584","observation_id":"6f361231-9711-47cb-9312-7f862d8e5375","resolution":{"observed_at":"2026-08-06T22:50:18.680565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T22:50:18.810031Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.810031Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:7d3100fc14a8f9be2716d095050a128be971db002cc228351a404e4a28408b7a","observation_id":"70c9825e-c934-431e-8d64-f54b8d32d00f","resolution":{"observed_at":"2026-08-06T22:50:18.810031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:20.111504Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"9ea02076-ade0-4e6b-8d0d-39ed2d13ae9d","year":2002},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.910040Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:b82276f3cd0afe98a1c436dd1a94f1acbdaa84253beaad5667a9fa8d7e3de648","observation_id":"32085a35-0253-4df7-8cd5-ad8bcac640db","resolution":{"observed_at":"2026-08-06T22:50:20.185852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:19.926331Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":"fb39aeb9-02b6-4ad7-8c64-5c87b8dca78d","year":2004},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:18.986504Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:bda269cd06db36c0e6441068cd532026631d3d35bd22befd82b69e5a213746ae","observation_id":"01d30384-c551-4554-8164-c849f04af813","resolution":{"observed_at":"2026-08-06T22:50:20.023610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:19.751610Z","title":"Meteor universal: Language specific translation evaluation for any target language,","venue":null,"work_id":"2f806848-f769-41b8-bfc4-4edb94c194e1","year":2014},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:19.064066Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:d492199c52659ecbee4a2bed6d35496d266757025ef48b99da23883446c0eed9","observation_id":"e26829a0-8529-4f03-830a-b4ef52a28203","resolution":{"observed_at":"2026-08-06T22:50:19.837312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:50:19.549724Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":"ac4e9f2f-fe5e-4b29-8c5e-a10871695eb1","year":2015},"citing_paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:50:19.144468Z"},"links":{"citing_paper":"/paper/2506.20567"},"observation_digest":"sha256:a2dac795108f4fd95a7533c9742698a0a4a3ac01681aa3a510b3f60a344e1978","observation_id":"74b25128-b4d9-47a4-83a4-de850d387842","resolution":{"observed_at":"2026-08-06T22:50:19.640902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20567","last_updated":"2025-06-25T16:02:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T16:39:11.733175Z","submitted_at":"2025-06-25T16:02:04Z","title":"Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2506.20567."}