{"as_of":"2026-08-17T18:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df7a35ff2c0ee9ecde85009479df3b237d28aa8be78f17e5f97a2a97ebe9c581","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T10:57:38.415005Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.10072/citation-record","integrity":"/paper/1908.10072/integrity","json":"/paper/1908.10072/citation-record.json","paper":"/paper/1908.10072"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.640956Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"42e2c9e3-330f-44b3-98b8-0ff2aa4a2bd3","year":2005},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.041580Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6f1d71ba72a447194cabac4b693cf2d01a7b9a65a0cb0801b5042d897d7c8b7e","observation_id":"1873e6e7-db75-48f2-994e-6742a4b95208","resolution":{"observed_at":"2026-08-14T10:57:39.651622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.623594Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"1a0b1aa3-504b-4ce8-aee1-950108cf5be3","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.047580Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:0bf6b48ebb94ff4bf4507bb9e47a5dd07a6f27977eafbbab23b79270cd32d6f4","observation_id":"021b16e0-d146-4917-b487-dd4c5234eea9","resolution":{"observed_at":"2026-08-14T10:57:39.629639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.606539Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"8644f86f-55d9-4361-9b25-aac0b9bc3f9a","year":2011},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.053330Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:eed7a10772b88444770b8ad550d1f6c0999a38905d53fd7acf874b6b8a40fd3d","observation_id":"c7d2996c-835a-41d4-ba78-3a57282b3503","resolution":{"observed_at":"2026-08-14T10:57:39.612282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.587753Z","title":"Video captioning with guidance of multimodal latent topics","venue":null,"work_id":"3a8fb844-1eb3-400b-9430-02aded5b9e8b","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.059178Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:850de90812eb3d8b8e8bed86caf234969d58a09db0ad47b9fc538213c7b74820","observation_id":"9df306c4-4e7e-4c5c-a4db-86ac34445603","resolution":{"observed_at":"2026-08-14T10:57:39.594185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.567836Z","title":"Motion guided spatial attention for video captioning","venue":null,"work_id":"c3aa51e0-0087-4458-bb69-ff36ebab1850","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.064496Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:0e62138d85134191d407efe8d3a094787009dc4679c38ec4b55aacda77d9c703","observation_id":"41befd8a-49ea-4e0f-926d-ae5b944f8b9c","resolution":{"observed_at":"2026-08-14T10:57:39.573543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T10:57:38.069975Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.069975Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c9c1beaa149bbe4043d6a9b63d255af6e8673d79aedc2616151cfc63d425145e","observation_id":"7de028ad-7c2e-4fde-a3a9-8c9e009071cb","resolution":{"observed_at":"2026-08-14T10:57:38.069975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.549480Z","title":"Regularizing rnns for caption generation by reconstructing the past with the present","venue":null,"work_id":"d3307853-135c-4122-a159-d0294ee14d1d","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.076492Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:650b132e22d7e28efb877e45b44371877b7be704e7a7ce9f164eaa9151af919c","observation_id":"481f45ee-4ef8-412c-8145-ec313b212b6f","resolution":{"observed_at":"2026-08-14T10:57:39.554748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.532739Z","title":"Less is more: Picking informative frames for video captioning","venue":null,"work_id":"12874015-3890-4996-9970-80972cd9fb4f","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.081380Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:5ef98dc2a63cd90cde4c1fd87b264a9cc0b2c82ac69c3060d5860ef2ebb553a8","observation_id":"d75d3be0-b701-4797-88fd-00040d78ea1e","resolution":{"observed_at":"2026-08-14T10:57:39.538263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.515701Z","title":"Embodied question answering","venue":null,"work_id":"735ddd63-44f9-4140-8ce9-aa2ebfe78ca2","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.086671Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c43aac63c830cf1892c573be7125ef8a7c1fb669fad7df5d7ad8f19b9535e4d9","observation_id":"34ce0a48-94d5-47ae-9fe5-34e52be0ad7d","resolution":{"observed_at":"2026-08-14T10:57:39.521481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.498478Z","title":"Diverse and controllable image captioning with part-of-speech guidance","venue":null,"work_id":"f05f5230-9273-42cd-815b-336e6fa8318c","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.091702Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:1b058e06bd412cf3658fd955baa60ed3efeecbfdeb1a6f016d445d50f4725fc4","observation_id":"cab863b8-345a-49e2-95ac-b02654e6a053","resolution":{"observed_at":"2026-08-14T10:57:39.504035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.481915Z","title":"Long-term recurrent convolutional networks for visual recognition and description","venue":null,"work_id":"c86af19e-43c9-460f-a3e7-084482d0af3e","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.099165Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b8131bda99e7f35aa7a27e90de1cff00fe24bd5d3a27899936f4685f8f27f9b2","observation_id":"2c82ff3d-679d-4f8d-ba5a-e0381c22deb6","resolution":{"observed_at":"2026-08-14T10:57:39.487390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.463271Z","title":"Unsupervised image captioning","venue":null,"work_id":"1a9442d5-8841-4520-89e6-8c855b328b71","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.104751Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6665e3be72f5f5d3de3c787ea173c408f6d2ceb833c570b26a82313b58803b63","observation_id":"f8fd452f-6470-4535-bc1a-c6e806eb8b79","resolution":{"observed_at":"2026-08-14T10:57:39.468755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.445443Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding","venue":null,"work_id":"c1c6cc1f-94b7-4b7d-a2cc-d32fc03260d1","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.109755Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c43d596afe1b00e5f336a601efbcf7f60a2311a6f2491beef18e8112bb41f382","observation_id":"5091e6f7-4a65-40e0-ab93-8ad3849c18b5","resolution":{"observed_at":"2026-08-14T10:57:39.450592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.427844Z","title":"Semantic compositional networks for visual captioning","venue":null,"work_id":"5807bf04-b2cd-42f8-9c0c-3490487e64f5","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.115264Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8afcbd836a118992489a511b40abb3188ba17dcdffc8e825258093a5192ae596","observation_id":"4df725c0-297e-43d6-b786-a5bca031cd73","resolution":{"observed_at":"2026-08-14T10:57:39.433743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.407497Z","title":"Youtube2text: Recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition","venue":null,"work_id":"55fc4d24-d6d3-4a68-b677-5c1aaa7f9388","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.121213Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:dd94d5dfa7970bcf9e1869dd927d2999385ec18d8760783da81970298a19593d","observation_id":"5f1b3ffe-4ac0-4288-9a15-f6affc13d424","resolution":{"observed_at":"2026-08-14T10:57:39.414528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.386878Z","title":"Image caption generation with part of speech guidance","venue":null,"work_id":"cc765454-f93d-45ba-a4be-7eaea3731976","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.126470Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8538b702232b76caef69fdd55a33d8378d7bcd532236b91f269b7af302d6dc26","observation_id":"3a93c80b-12b3-45ec-86a7-4ca44ba535a6","resolution":{"observed_at":"2026-08-14T10:57:39.392423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.367549Z","title":"Recurrent fusion network for image captioning","venue":null,"work_id":"20eab0b8-69fa-4d40-977f-3f7d6ca67499","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.131519Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:e0ba8e178c626c8bc9b62a377a9fd720cef32bf106852972765b1068712f6c49","observation_id":"d137cd4b-5e2f-46a4-b370-e29aa33a6ecd","resolution":{"observed_at":"2026-08-14T10:57:39.373534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.349176Z","title":"Describing videos using multi-modal fusion","venue":null,"work_id":"2e48dbb1-6edd-4538-8118-72e43b1a2e39","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.137521Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:e50bca4179a0988c971c1d9b26c32d1743d856e275ee05935a1e596756cd42fb","observation_id":"37133a6b-b580-46ff-9cf8-4f59c9d78d39","resolution":{"observed_at":"2026-08-14T10:57:39.354958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-15T11:35:18.832923Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-14T10:57:38.143226Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.143226Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:5066dc376d0c2e1da08cde0277acb4ae404ff63232d4269ca025f901d51f4c33","observation_id":"b11ab0e7-a50b-4e99-af94-a08eca01a820","resolution":{"observed_at":"2026-08-14T10:57:38.143226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.331786Z","title":"Hadamard product for low-rank bilinear pooling","venue":null,"work_id":"8f717dd8-6158-4dd3-941d-66511879f7b2","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.151471Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d7cef312c4d6e7a2820209b88d4eb9f0aae12ed2eb2541b13eddd12cdea1487e","observation_id":"c7fcec0e-8678-4bc7-ae8b-d7fee8afe461","resolution":{"observed_at":"2026-08-14T10:57:39.337697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.311892Z","title":"Natural language description of human activities from video images based on concept hierarchy of actions","venue":null,"work_id":"e98fe796-94c9-4d49-894f-927b9c7fadf1","year":2002},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.157564Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:538be6130a22054f4619a9064d2f4de6f382cafe7ae17ed09927ec16e2aec834","observation_id":"fd5448d2-06ec-4839-94be-8a646803e163","resolution":{"observed_at":"2026-08-14T10:57:39.319316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.168749Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.168749Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:63910ac4e114a7296ac99d416b8a6d81862104c39f0f9e65d7f53af07d289efd","observation_id":"5baa7aad-7032-48e8-aa80-26f5f6fc6183","resolution":{"observed_at":"2026-08-14T10:57:38.168749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.273043Z","title":"Sibnet: Sibling convolutional encoder for video captioning","venue":null,"work_id":"1e125d49-161d-4686-a447-abd3f76ec0c7","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.176170Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:38c0e60069ab0af18bb9d9a6bae8087e84ae94fec448cc02a342cebbe0e02b60","observation_id":"d6ffe39b-b72a-4915-8561-e5da7eb56eaf","resolution":{"observed_at":"2026-08-14T10:57:39.279723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.255513Z","title":"Matching image and sentence with multi-faceted representations","venue":null,"work_id":"8f030e4d-7ab9-4ec8-8aa7-3580d2b268ac","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.181550Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:ba4000a1f9f2b20a421f42f5f4af9a1bdcb506b12bf7117df18a9a14b1f83cf9","observation_id":"1bc14e2a-7463-42a6-a223-3813c20f5cce","resolution":{"observed_at":"2026-08-14T10:57:39.260563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.239058Z","title":"Learning to answer questions from image using convolutional neural network","venue":null,"work_id":"ee537a93-63d8-4072-b8c8-a5db26fe8d9d","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.186885Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b2fb2d3811a85070e336c6d00e8c3f8107cf36efd9389273ea57b02ccbdbc59e","observation_id":"700d4d2c-c917-4829-bd71-ea8df1bb4df0","resolution":{"observed_at":"2026-08-14T10:57:39.244241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.222547Z","title":"Multimodal convolutional neural networks for matching image and sentence","venue":null,"work_id":"ab20f352-536b-4a8b-8a16-3b05268ca62d","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.192462Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:83a620fb4e9a47150fcca2650bf546cf0b4921173c91a7781399eb7c0e4a0e7d","observation_id":"9a572c67-6bea-4cd4-be14-2846aa3b6a65","resolution":{"observed_at":"2026-08-14T10:57:39.227761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.205535Z","title":"Jointly modeling embedding and translation to bridge video and language","venue":null,"work_id":"1b661b8e-a290-4974-8645-38c91ff8f539","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.198856Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6ce7e21744005556cefe7b2226a7df40be5a4fc7124eab9fe6c07a7b1b8a6207","observation_id":"c9dae1cb-c071-497e-8df2-ade0bfbab609","resolution":{"observed_at":"2026-08-14T10:57:39.211142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.187678Z","title":"Video captioning with transferred semantic attributes","venue":null,"work_id":"8117ddf3-b5b1-40be-9d52-83a20a163c5e","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.204428Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:461342a1828c4cd84a3ea817114422dc60b4d67654f5cc105ccd653670d430f9","observation_id":"c5c7377c-0eea-44d0-9384-882e23422678","resolution":{"observed_at":"2026-08-14T10:57:39.192777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.171641Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"1ca50e32-a025-4b67-951a-abb460e90761","year":2002},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.209681Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:0c2b044275372c31f8133b225b982bbced565b96176f4dceaec6307df04bd165","observation_id":"17f6b06a-f575-46f8-9748-75a7407ac00d","resolution":{"observed_at":"2026-08-14T10:57:39.176958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.154543Z","title":"Tv-l1 optical flow estimation","venue":null,"work_id":"646d1ce7-d9b1-4609-ba9f-bfc18adf7867","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.215643Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:771e9bf960da64b9e3a58fe2df9ecb5cbdb3ed402431e3171f10ce98a8c68aeb","observation_id":"d16035c1-df84-4eb6-9130-bbee5849f4fc","resolution":{"observed_at":"2026-08-14T10:57:39.159957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.138047Z","title":"Multimodal video description","venue":null,"work_id":"6c5b5e46-7b9f-4661-87fd-8965123243ef","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.220829Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b19045389f75da039a699d438b59bf50d1747510de77ca90f4d70e6abc424b13","observation_id":"1f5c2d93-c0ba-4599-8f61-dec9b559090e","resolution":{"observed_at":"2026-08-14T10:57:39.143375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.120816Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"177ada68-c481-4b22-9578-499aba87e990","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.226951Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:2cdf6043dcbcc07447a2ef16aab4afb7aca68cc753884fce6983abf33b390b80","observation_id":"125438e3-74ba-4c9c-a42c-ed07a30c43a5","resolution":{"observed_at":"2026-08-14T10:57:39.126286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.103666Z","title":"Coherent multi-sentence video description with variable level of detail","venue":null,"work_id":"4d01027b-6d61-4735-b31a-5d8e72aeb578","year":2014},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.232533Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:ea6cc43677bd1160268ea3044ca15eccba1eedb7f7d2e92b5b7e9188e1a83758","observation_id":"0a6eba4c-8f05-4e06-99ed-98f2b8e01e39","resolution":{"observed_at":"2026-08-14T10:57:39.108828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.087737Z","title":"Translating video content to natural language descriptions","venue":null,"work_id":"cbfdf043-1c00-46eb-b081-e59631a7eab9","year":2013},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.238054Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:66295436afd065d6b31b5382df5d046426a84b8710f60a73700877856f9c7e92","observation_id":"25f0ed17-dd4c-440b-b6ac-b34f75bacfd9","resolution":{"observed_at":"2026-08-14T10:57:39.093009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.070415Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"09fab800-b9c1-4d0a-8511-a044c8028bb5","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.246095Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:817630d461342f796930eebe08889e832fa87fbbd05652107ee941df2b2cdb34","observation_id":"1bb049a4-948f-4de3-8b78-667998310f40","resolution":{"observed_at":"2026-08-14T10:57:39.075893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.052492Z","title":"Frame-and segment-level features and candidate pool evaluation for video caption generation","venue":null,"work_id":"aba1e133-a1cd-4a87-9721-93c0d6f8b551","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.252404Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:7c630963ebba844093c06494df53b54ef40304d3eb7611c278b3b1dcc107af06","observation_id":"5d73ab8b-b969-4a39-a3b5-52386a26d2d1","resolution":{"observed_at":"2026-08-14T10:57:39.058047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.033784Z","title":"Quantization-based hashing: a general framework for scalable image and video retrieval","venue":null,"work_id":"2401f6de-1735-4750-9da4-d434e5e3b3ac","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.258742Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b0226402023ad822ae7326d507bf9a6f5cc6ab1a315a800d8107e06147e26b38","observation_id":"c7427a89-25d2-4d56-ac26-5c1b8981e5b1","resolution":{"observed_at":"2026-08-14T10:57:39.039809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:39.016439Z","title":"Inception-v4, inception-resnet and the impact of residual connections on learning","venue":null,"work_id":"6490f64c-79f8-4e2a-ba9d-29f1c7704934","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.265410Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d332b2c99431dd2716340bc02248c78e8f9fc487aed0c86794090f52f3f54220","observation_id":"328ed9a7-2499-4e16-8773-4450a66adadf","resolution":{"observed_at":"2026-08-14T10:57:39.022436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.997676Z","title":"Feature-rich part-of-speech tagging with a cyclic dependency network","venue":null,"work_id":"b1cab2cf-a3e1-41b3-950d-e651f9096154","year":2003},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.272559Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:90129610214e9fd4aa6f144feafad35407355541cbc7a1a95ec95042b3e6bc9c","observation_id":"a8ef05c7-5dff-4789-9594-33bf05158b2c","resolution":{"observed_at":"2026-08-14T10:57:39.003880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.973650Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"a089365c-1117-437b-a8ef-a423cce5ebd4","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.279403Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:6a509f1443e73cabfa2ae790746b95d485c731c50ed22f93f5d9098350fa601e","observation_id":"f73729ed-960a-4aea-9987-e82694235fea","resolution":{"observed_at":"2026-08-14T10:57:38.981064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.951849Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"ade343f1-1cfe-4d0e-b50f-72ff711e0f20","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.284378Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:bb7ab10d2e0b3e0ce4535524c14d847bb55054c1cd442e5c47d8f83920858f80","observation_id":"9e318745-2eb7-46a5-bc12-d5c4a9cc3744","resolution":{"observed_at":"2026-08-14T10:57:38.957250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.934843Z","title":"Sequence to sequence-video to text","venue":null,"work_id":"60bfa51a-fbeb-4a77-8865-988c5a5b50d7","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.290185Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:db52f03f555326d6f0506dbc553eb1bec7e5d07754e7523fbf48d4b3780840b0","observation_id":"c4fb9dbb-b469-4a6e-a081-6a7517c5fc11","resolution":{"observed_at":"2026-08-14T10:57:38.940058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.914825Z","title":"Translating videos to natural language using deep recurrent neural networks","venue":null,"work_id":"bed00a3f-9e54-499e-8762-bb4b2e37200a","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.297238Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:ad9d70f7388aaf057818afb95a27941a470fdfd4a781bfd27f0be28a1fd7bf8b","observation_id":"e5e326db-5329-435d-8d2e-2e5f3a6da194","resolution":{"observed_at":"2026-08-14T10:57:38.921555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.891996Z","title":"Hierarchical photo-scene encoder for album storytelling","venue":null,"work_id":"ace843e7-6928-4d0c-8ff1-7def749d9c09","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.303765Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f51def1a21b7fe306da17579ee2755e0470b32021e55b43500e144c6fc10239a","observation_id":"408adeae-2df5-4cde-994f-197dd7e1f8e2","resolution":{"observed_at":"2026-08-14T10:57:38.898224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.873236Z","title":"Reconstruction network for video captioning","venue":null,"work_id":"3fc5d526-5096-4cac-a3dc-35b73addf165","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.309023Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:8fc4ec76a7301c79ea33284c4c72feb35843a6935b1746d2ff1ea7b1ee66469c","observation_id":"c28207be-6357-408c-9aee-dd507a4f322e","resolution":{"observed_at":"2026-08-14T10:57:38.879932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.854917Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"beec9b10-6dd1-4a60-bc69-bd2c33ed369b","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.314056Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:14e9a21dcc74a83b1a66e51d6d62806b4e552acf9aaf7ec31848b7fb9c79f2ec","observation_id":"0da1353e-262b-4929-8318-89f3cf4832e4","resolution":{"observed_at":"2026-08-14T10:57:38.861169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.838054Z","title":"M3: Multimodal memory modelling for video captioning","venue":null,"work_id":"427dbe3c-0b49-434f-bc68-8c6d41b8adc6","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.319099Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b4fff6e0e471796aace841e05a842964a25dfa0828691207e12e1b930dcfe146","observation_id":"fb9e6b81-abac-4d4c-b220-38e3d1fa02fa","resolution":{"observed_at":"2026-08-14T10:57:38.843411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.819610Z","title":"A survey on learning to hash","venue":null,"work_id":"ca6f7837-ba3f-4acf-9864-827b5d822233","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.324097Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b80ab0b0a93783cee1f9d8b9c4574179aa4e756f71751083302c23e11ba24ad2","observation_id":"f54d4121-39f4-4b6a-8d35-7ff8fae36104","resolution":{"observed_at":"2026-08-14T10:57:38.825218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.801481Z","title":"Interpretable video captioning via trajectory structured localization","venue":null,"work_id":"055f9459-0ace-45ad-b4ed-d598579aecb5","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.329406Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:691d0b15d93b60042ee3201e5f56e28764cef2c343db9c9409ab22ba4bb03c98","observation_id":"8a66c135-e4c8-4d55-b55b-1cd98878b26f","resolution":{"observed_at":"2026-08-14T10:57:38.807467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.781743Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"cfa789b5-9737-4ca1-b4a4-7556c5625b89","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.334432Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:9d9f1866c013a0b4e391754fc2824b0770dfd907ae08c58355dc92459835b07d","observation_id":"28b260c5-3bdc-4cb1-abaa-56167eece4f1","resolution":{"observed_at":"2026-08-14T10:57:38.788354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.759594Z","title":"Learning multimodal attention lstm networks for video captioning","venue":null,"work_id":"3c7ba337-b592-4f55-9c12-35866d82d21b","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.339586Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:f43e4ae019d6f5d1be73f5ae8afc0c0fa3bce0ba4c034f6ff5c97153b3bd81b8","observation_id":"50162c04-e9e6-4aa3-85f5-32c46c1ffb3d","resolution":{"observed_at":"2026-08-14T10:57:38.765691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.738714Z","title":"Jointly modeling deep video and compositional text to bridge vision and language in a unified framework","venue":null,"work_id":"958de083-7537-4519-8043-924eb16306ce","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.345161Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:aeaf2d93763173a0ed3756f378a2e7d298eefb5ed78bc5ea53486ca106cbc17f","observation_id":"3f0aaf19-3837-458e-9e34-87f77d321aa7","resolution":{"observed_at":"2026-08-14T10:57:38.746357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.718650Z","title":"Describing videos by exploiting temporal structure","venue":null,"work_id":"d03c87ff-bde5-4580-a657-04b21969c342","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.354088Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:135091e285ee71e58f2cc8de988935bdf5c7f00ab819d07c786061eae75a495c","observation_id":"658ae573-f81c-4559-bda4-e7e81f1d461b","resolution":{"observed_at":"2026-08-14T10:57:38.724518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.694749Z","title":"Video paragraph captioning using hierarchical recurrent neural networks","venue":null,"work_id":"16ba69a2-9d1f-4a15-9531-f4b72efee7ca","year":2016},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.360033Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d49ff678afdef5336c28e6d0b59ef2bc2e6fd348892a9659dc2ab10a15f37aa2","observation_id":"a010624a-10c4-45f7-b188-3f0f6482ef5b","resolution":{"observed_at":"2026-08-14T10:57:38.703201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.5701","last_updated":"2012-12-22T15:46:49Z","snapshot_observed_at":"2026-08-15T00:34:41.793608Z","submitted_at":"2012-12-22T15:46:49Z","title":"ADADELTA: An Adaptive Learning Rate Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.5701","snapshot_observed_at":"2026-08-14T10:57:38.365230Z","title":"Adadelta: an adaptive learning rate method","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.365230Z"},"links":{"cited_paper":"/paper/1212.5701","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:4644fc89000f881073c062fddb566c6f66d8e6501ffaaafbcd1157a42f02b555","observation_id":"efd89af8-df75-4e7f-b627-91de1c30eefc","resolution":{"observed_at":"2026-08-14T10:57:38.365230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.673293Z","title":"Reconstruct and represent video contents for captioning via reinforcement learning","venue":null,"work_id":"c09e9881-7f76-4f8b-baae-0a2fecd46f8b","year":2019},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.371492Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:d3dd228a96d9fc90c2f807121a9d04c30f2224885b742f223daad567b7b89ba0","observation_id":"4296d482-517e-4e48-964d-212286737a98","resolution":{"observed_at":"2026-08-14T10:57:38.680241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.650869Z","title":null,"venue":null,"work_id":"adf60889-fba7-434b-840a-3d7b6bff2fe3","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.376450Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:47455f72fd9f68019e604bea244a1c6587967fea649c5a76d7ab7a3f3a6f0061","observation_id":"cab27f6e-071f-41d5-9e55-f7c21fd2b2b2","resolution":{"observed_at":"2026-08-14T10:57:38.656895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02300","last_updated":"2017-08-07T20:50:24Z","snapshot_observed_at":"2026-08-14T20:42:41.722907Z","submitted_at":"2017-08-07T20:50:24Z","title":"Reinforced Video Captioning with Entailment Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02300","snapshot_observed_at":"2026-08-14T10:57:38.381673Z","title":"Pasunuru and M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.381673Z"},"links":{"cited_paper":"/paper/1708.02300","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:695ca3ce0bfb95219e2bbea35b3799db89b2149d2b9760aa5630f39fb5903d67","observation_id":"9575ebe7-20b6-4b41-90cd-6d53b600021d","resolution":{"observed_at":"2026-08-14T10:57:38.381673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.630877Z","title":null,"venue":null,"work_id":"f3396b91-e553-47f4-be8a-e87c7fa33455","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.387488Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:3a42d125679205b6f6204fcc80d056bf21c71bc39318421239c99758b4015413","observation_id":"18fdd141-200f-401e-9a10-76be6874bb12","resolution":{"observed_at":"2026-08-14T10:57:38.636429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.612873Z","title":null,"venue":null,"work_id":"b4274d2a-5abe-4ff6-bb29-412dda47144c","year":2017},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.393036Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b09f607769e852cae492a0d2a0c43e99093dd903d364704dee26eb0a17bc0348","observation_id":"71e4be24-20f1-4bf1-aaba-8833c9e222e4","resolution":{"observed_at":"2026-08-14T10:57:38.618714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.595243Z","title":null,"venue":null,"work_id":"6946aa0b-4ddb-41d6-9820-5f7debad602e","year":1998},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.398564Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:55c549bd352a05bdd3ded2279141fd718d741f37b817db30382b5428415d61e6","observation_id":"5d62de1a-c435-4887-85d2-63b8ad041f82","resolution":{"observed_at":"2026-08-14T10:57:38.600523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.576260Z","title":"Vedantam, C","venue":null,"work_id":"e52de301-d17f-4582-a014-acdfead001a1","year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.404074Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:64ba4617cfaa7d47ca6fe0e6dabb255d86b932332902e410708b3936d6e70def","observation_id":"c8db4f33-38ba-4b64-afa1-e2ab34ba190f","resolution":{"observed_at":"2026-08-14T10:57:38.582150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T10:57:38.554250Z","title":null,"venue":null,"work_id":"542f9dd3-8e11-4b94-8ef8-ecfb3a865231","year":2018},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.409600Z"},"links":{"citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:b8d5c501244bc0576ece4ed813245da43a855aac98faa975a1fc9f2c1d9d913f","observation_id":"5a5ab054-33a5-47b3-a10b-26015aab2806","resolution":{"observed_at":"2026-08-14T10:57:38.561785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00521","last_updated":"2016-01-12T06:35:48Z","snapshot_observed_at":"2026-08-14T22:50:02.553800Z","submitted_at":"2015-05-04T04:14:54Z","title":"Reinforcement Learning Neural Turing Machines - Revised","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00521","snapshot_observed_at":"2026-08-14T10:57:38.415005Z","title":"Zaremba and I","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-14T10:57:38.415005Z"},"links":{"cited_paper":"/paper/1505.00521","citing_paper":"/paper/1908.10072"},"observation_digest":"sha256:c78ba0e90e4b85e091bda18af47be0462b97a08b319ea65234ac315df97aaa56","observation_id":"37f52123-9752-4d5d-9975-2604d131c8bb","resolution":{"observed_at":"2026-08-14T10:57:38.415005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.10072","last_updated":"2019-08-27T08:22:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T12:40:58.384002Z","submitted_at":"2019-08-27T08:22:54Z","title":"Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:1908.10072."}