{"as_of":"2026-08-23T10:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edc6356b87594f29718f8cd1f16f51f35de17725b00ff5a7e6342e82a8caa237","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T06:06:44.499410Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1909.00121/citation-record","integrity":"/paper/1909.00121/integrity","json":"/paper/1909.00121/citation-record.json","paper":"/paper/1909.00121"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:45.008488Z","title":"Jointly modeling embedding and translation to bridge video and language,","venue":null,"work_id":"de6e0a36-c442-4ba1-a517-3aa57592be93","year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.361502Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:99566d24b7ff3453700f15cdb6f0a14326af312e859eef5e03733146a932959a","observation_id":"2bf5375e-92a8-4163-a8f5-7407e3aa4d51","resolution":{"observed_at":"2026-08-14T06:06:45.011263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.127","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.551583Z","title":"Semantic compositional networks for visual captioning,","venue":null,"work_id":"009aadd2-0db5-4b1a-b327-e656df4b4294","year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.365257Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:5e4875680d1696b64b505f35381b578054a5ddf553648b5f2ba698943fd80ad6","observation_id":"45fc1d89-3cda-42f7-bf65-301f02a1ebf7","resolution":{"observed_at":"2026-08-14T06:06:44.554569Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:45.001456Z","title":"Video captioning with attention-based lstm and semantic con- sistency,","venue":null,"work_id":"225bebbe-b152-44b3-a63d-c5ced79ab294","year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.368152Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:9d879d6553c76ed40567653779ffffd7a9d53e3513a129776ba1a99201fb1ebb","observation_id":"2b1ddf43-83e2-4730-9772-a92f983559b5","resolution":{"observed_at":"2026-08-14T06:06:45.004263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.994354Z","title":"Reinforced video caption- ing with entailment rewards,","venue":null,"work_id":"109b701c-62da-4f9a-9c2b-3fa76c6c801a","year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.371070Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:6edbae5ba47f0a755b1fe0b0f22a6e6118b5e2177d66e2ffeb9e0ed5eed93a74","observation_id":"f4aabf7f-b95d-4151-b267-2eb570373754","resolution":{"observed_at":"2026-08-14T06:06:44.997168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.987133Z","title":"Sequence to sequence - video to text,","venue":null,"work_id":"810024fa-07e4-4f74-b3dc-b97bd9d3fa81","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.374158Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:3ccd2368747080dce2f42ec14f13daf81e3607c44e71397be026524fd09b80ec","observation_id":"1e834d07-ab52-453a-85e2-d8b6ec16bff1","resolution":{"observed_at":"2026-08-14T06:06:44.989948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.979915Z","title":"Long-term recurrent convolutional networks for visual recognition and description,","venue":null,"work_id":"5eb476c0-b282-4489-b7aa-29f2348fd5e7","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.377091Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:78c45b4f408ebeb516419e2af0eabbc17aff503750edd372b9c5b8f3e7a82ef6","observation_id":"f3233cf2-84c9-4507-b149-75f910086577","resolution":{"observed_at":"2026-08-14T06:06:44.982795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.972109Z","title":"Sched- uled sampling for sequence prediction with recurrent neural networks,","venue":null,"work_id":"ad005152-2270-4bec-9612-633b1f3ccdda","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.380358Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:03daf1bc69e2660c50aadc58a4b749404c06d6badfb85158a47d7b43d0abdf63","observation_id":"f53b4f61-b125-4143-bf2d-c9724a9c1aef","resolution":{"observed_at":"2026-08-14T06:06:44.975135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.964615Z","title":"Learning phrase representations using RNN encoder-decoder for statistical machine translation,","venue":null,"work_id":"933f03d8-d817-4408-a482-369e7c717df4","year":2014},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.383158Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:3ba22494c901b3de21afc9aa048c23a447dc79b6b800ce7820918813456ceda8","observation_id":"67c81ae3-31ae-48fe-a7bf-d9bf47c1e59a","resolution":{"observed_at":"2026-08-14T06:06:44.967431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.957078Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":"6521e05e-e77e-4ef2-af22-7fed1dd7a128","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.385751Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:ce289a3ea81561be2f3e6951f536fed2e5cf29ec93469ec64a255084fa504dc8","observation_id":"4fd4f53c-1b94-4fc5-aba9-a729b557d6c7","resolution":{"observed_at":"2026-08-14T06:06:44.959992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.1090","last_updated":"2014-10-04T20:24:34Z","snapshot_observed_at":"2026-08-20T20:31:42.807974Z","submitted_at":"2014-10-04T20:24:34Z","title":"Explain Images with Multimodal Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.1090","snapshot_observed_at":"2026-08-14T06:06:44.388985Z","title":"Ex- plain images with multimodal recurrent neural networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.388985Z"},"links":{"cited_paper":"/paper/1410.1090","citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:0cbddec1f00c8c2272bf9c7b270878f88b1f314edeb66dcabdc1ee2a8743952f","observation_id":"cb1bf66e-d6ee-447b-bf2d-b63a4b6a32ae","resolution":{"observed_at":"2026-08-14T06:06:44.388985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.949687Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":"cab89a7e-e4d3-41de-8f3f-ebb3936ef331","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.392701Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:64f98101e081a94fa6ca98143a395ee46e9b0f0ad2730d34aafec17f872cf731","observation_id":"df5dcd4b-217b-4dbd-85a6-61e5b2909dfd","resolution":{"observed_at":"2026-08-14T06:06:44.952548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7755","last_updated":"2015-04-23T16:49:23Z","snapshot_observed_at":"2026-08-14T23:57:21.557178Z","submitted_at":"2014-12-24T20:58:23Z","title":"Multiple Object Recognition with Visual Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7755","snapshot_observed_at":"2026-08-14T06:06:44.398896Z","title":"Multiple object recognition with visual attention,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.398896Z"},"links":{"cited_paper":"/paper/1412.7755","citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:7290465602997471356a083b3f0376dfc5062780d90ec8c22756ba32c6402b48","observation_id":"91dbd382-25e7-48f9-be37-709c84993af0","resolution":{"observed_at":"2026-08-14T06:06:44.398896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.401874Z","title":"Image captioning with semantic attention,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.401874Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:1c98927b8b68f94b0df6480b68025f00e3484bf2c8a81b20de34add478927714","observation_id":"5ae46ee7-4b37-48b7-913e-e88a60d45c14","resolution":{"observed_at":"2026-08-14T06:06:44.401874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.942058Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"a1ac74f5-bf13-4de0-ba67-28d747f6f8f2","year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.405099Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:254ca7e2208c40c65e6273e08229f90b6c8ab22c00fe374a17379733e1d07d3f","observation_id":"d34eebab-bd07-4d29-a23b-792ff1fec0d8","resolution":{"observed_at":"2026-08-14T06:06:44.945047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.408048Z","title":"Self-critical sequence training for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.408048Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:db8f339d69b0a9795809f4b19357cff92df31ccbd6f29a2badda0e9147971ccf","observation_id":"3a0c0e74-f73f-4923-b536-b50c519b0f59","resolution":{"observed_at":"2026-08-14T06:06:44.408048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.934156Z","title":"Exploring visual rela- tionship for image captioning,","venue":null,"work_id":"e56aab48-d092-45db-b060-e189d7904e7e","year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.411115Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:1061f01562e3e22ff8c98d853e07ab5465d23bb1cf8e984cb9c28e5b3b5d34c1","observation_id":"fa7fc737-65e4-4b90-b103-bcd77cfd67fe","resolution":{"observed_at":"2026-08-14T06:06:44.937156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.926200Z","title":"Multimodal trans- former with multi-view visual representation for image captioning,","venue":null,"work_id":"ecf8631f-22bd-43cb-b406-a8d0db60f1ac","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.413770Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:7f0f43a79c955aa9769bfeb20c59090b5fb591d1d575a501d1631e4947e25697","observation_id":"2e5aa482-c04a-420c-a51c-0b21576930d3","resolution":{"observed_at":"2026-08-14T06:06:44.929080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.918017Z","title":"Meshed-Memory Transformer for Image Captioning,","venue":null,"work_id":"efae1d15-dfca-4a80-9753-5dc7a4960b70","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.416423Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:5af0840ea8eba3a92186371af083709051c0c398af3cf8af4d29d072f6a88d9b","observation_id":"1847ea75-d5b4-4889-b646-6753a39f076e","resolution":{"observed_at":"2026-08-14T06:06:44.920957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.908943Z","title":"Controllable video captioning with pos se- quence guidance based on gated fusion network,","venue":null,"work_id":"41f9edd6-ba24-443b-b3b5-3b63eab7285a","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.419220Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:b437ab742069b555cdc47e359c4601a8a97625e6d7ecfb3161129f3ca22f3ba9","observation_id":"c1a30203-1804-4196-8ca6-6d41170cc6d2","resolution":{"observed_at":"2026-08-14T06:06:44.912353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.900187Z","title":"Memory-attended recurrent network for video captioning,","venue":null,"work_id":"e37ec5a8-7873-45a6-8d87-07a82632b6aa","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.421849Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:796e9fbd23a8f3ca1fd7b19e2ad4910de62ad478b3ec2855628c90c59b1b8245","observation_id":"d8e9073e-77d7-4ae2-a664-d4a625e3eb38","resolution":{"observed_at":"2026-08-14T06:06:44.903361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.892487Z","title":"Joint syntax representation learning and visual cue translation for video captioning,","venue":null,"work_id":"23a0c6c8-b784-4d58-96a2-016666daea5b","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.424398Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:b6b28247f20492e9cd7dab6c9b7dc566722533f8a7dcec77bbaef5bf18b48870","observation_id":"48e0d08f-a4fd-47aa-bb92-b808172a3563","resolution":{"observed_at":"2026-08-14T06:06:44.895332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.884595Z","title":"Spatio-temporal dynamics and semantic attribute en- riched visual encoding for video captioning,","venue":null,"work_id":"47ab3a9d-b492-446c-bcce-54d7b6dd3977","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.427108Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:6bb0c1e2e47cf722c6cc3dbc92e35eb5266afa4b791f3e6ddb935a115dbd6b4e","observation_id":"c31d7597-7d58-4392-9dde-eef20fdd0ac9","resolution":{"observed_at":"2026-08-14T06:06:44.887461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.876236Z","title":"Syntax-aware action targeting for video captioning,","venue":null,"work_id":"7d71bbcf-8d70-4e17-9bf5-b0a46bc47f5d","year":2020},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.429769Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:7bef9c903159fd95ea6b8042baf3350da1f5aaf89ca185e82770b43e2542c437","observation_id":"84f23a4c-6298-4dd9-975a-12a79570c1d6","resolution":{"observed_at":"2026-08-14T06:06:44.879459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.867425Z","title":"Video paragraph captioning using hierarchical recurrent neural networks,","venue":null,"work_id":"98f86041-b851-4d9f-a4fc-a6cc52411b30","year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.432514Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:fa167b879ef24022b6c02d1afa7ab3640925d637ac564a2d9420d3a7605c5953","observation_id":"49460937-d7f6-4039-89fa-aa9af015551d","resolution":{"observed_at":"2026-08-14T06:06:44.870474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.857867Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":"b58003ec-275c-48be-a072-df5b8dfacb76","year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.435006Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:1bf1b35400055eb388941b7e35a6ad36f7e9ad3050d4200066bc3a960b07038f","observation_id":"2e952d92-56e7-4c12-a685-67829cbce697","resolution":{"observed_at":"2026-08-14T06:06:44.861077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.334","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.532356Z","title":"Top-down visual saliency guided by captions,","venue":null,"work_id":"69482038-ba8c-4f55-a5e1-6fab4eaf7b9f","year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.437755Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:d2450e8b05025c4cf687bd71a176c3463153d38dd16c6487fadc363caf5c2702","observation_id":"e6aadcce-ce67-4871-a23d-e0759bf01ea1","resolution":{"observed_at":"2026-08-14T06:06:44.537169Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.440408Z","title":"Less is more: Picking informative frames for video captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.440408Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:3f85fde28ca407a33fad75cf908997e40033c194bd499c65649450a363087552","observation_id":"49ca774d-f854-4622-abe0-fe67f999202a","resolution":{"observed_at":"2026-08-14T06:06:44.440408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.848482Z","title":"Watch, lis- ten, and describe: Globally and locally aligned cross- modal attentions for video captioning,","venue":null,"work_id":"f3e0ac0c-70f3-4875-b577-c7f30b451739","year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.443883Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:d36a52389f4a4b1d983bcede95423463a6d5dda8ab5d9b77de251c1be25e33d3","observation_id":"d8515a68-3524-4354-b627-1aa5f0693935","resolution":{"observed_at":"2026-08-14T06:06:44.851609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.839521Z","title":"Multi-task video captioning with video and entailment generation,","venue":null,"work_id":"413706e1-d109-4771-a1ae-406388bf5ec3","year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.446627Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:994ce339c7b205991c3b2f1d3aa052d4d955aaec287e82cabfd1fabe6b29dd7f","observation_id":"0a684f27-ffac-40bf-9eeb-9eba672329c2","resolution":{"observed_at":"2026-08-14T06:06:44.842776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.830311Z","title":"Videobert: A joint model for video and language representation learning,","venue":null,"work_id":"6f068a6b-41f9-437c-b8a5-47aad71d95e5","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.449222Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:1a1b0ecd64f75632e3c5048bacd7b1ab58aa5a2547cb927027c1569874af59b8","observation_id":"4bd62083-3c82-4e17-bbb5-7cfd5d85da14","resolution":{"observed_at":"2026-08-14T06:06:44.833573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T06:06:44.451806Z","title":"BERT: pre-training of deep bidirectional transformers for lan- guage understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.451806Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:2e4002dc1909e0e27ff069a7e9a1908bb804ed0be797e9d062b052d643e5b9cb","observation_id":"6673947a-22c5-4b3e-810f-861a7f7e52da","resolution":{"observed_at":"2026-08-14T06:06:44.451806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.821298Z","title":"Learning to compose topic-aware mixture of experts for zero-shot video captioning,","venue":null,"work_id":"13b37c38-e33b-4784-92c7-df2226fa353a","year":2019},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.454636Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:11c62b2f27daff9068b8cc75c8ad2d9fb95541d3a489ef79adfd464c3281d49c","observation_id":"852d4678-8910-40d1-bfe8-8e40f8d737f0","resolution":{"observed_at":"2026-08-14T06:06:44.824579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.813238Z","title":"Spatio-temporal graph for video captioning with knowledge distillation,","venue":null,"work_id":"3a456616-278d-4448-9ed1-8d65fcb954ed","year":2020},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.457037Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:c5c594e720fffddea2abcbc16a882d0fa3e1961d24b73086052c3522e79b9a8c","observation_id":"15b7ff8e-88c6-457e-940a-8a2608881faf","resolution":{"observed_at":"2026-08-14T06:06:44.816173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.459692Z","title":"A learning algorithm for continually running fully recurrent neural networks,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.459692Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:3c047aee89e85ab9ab72f5ee7fd82ea316bf87c4e6618305eff45b37e4950af7","observation_id":"c25fddfe-95c7-40f0-9ee0-0851630838b0","resolution":{"observed_at":"2026-08-14T06:06:44.459692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05101","last_updated":"2015-11-16T19:43:19Z","snapshot_observed_at":"2026-08-18T16:05:28.517324Z","submitted_at":"2015-11-16T19:43:19Z","title":"How (not) to Train your Generative Model: Scheduled Sampling, Likelihood, Adversary?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05101","snapshot_observed_at":"2026-08-14T06:06:44.462514Z","title":"How (not) to train your generative model: Scheduled sampling, likelihood, adversary?","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.462514Z"},"links":{"cited_paper":"/paper/1511.05101","citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:2ab7e89a3683529059acd747bd2004a6565bd625bbfb063fe398a873b23fb3c3","observation_id":"3ce565dc-561f-45aa-ae63-3a51ff2864ef","resolution":{"observed_at":"2026-08-14T06:06:44.462514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.801602Z","title":"Professor forcing: A new algorithm for training recurrent networks,","venue":null,"work_id":"a53dc751-b01a-48a0-971a-7b6560b04f79","year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.465779Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:a8edd76910ea5d64d5403f25839d970350cf069bdae400ee5cbde754cdf9a7cc","observation_id":"7bd7a385-4d82-4455-a3e1-c122c55be88a","resolution":{"observed_at":"2026-08-14T06:06:44.804616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.793577Z","title":"Object relational graph with teacher-recommended learning for video captioning,","venue":null,"work_id":"b8a1847d-656f-47af-afa9-25a819a01346","year":2020},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.468478Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:d031ca15d5fd5bd7f9cb352d15e7740e30618443c9b88bb03c0a0c65b746afa3","observation_id":"d5b35215-b44d-4e26-8667-029397fcd84a","resolution":{"observed_at":"2026-08-14T06:06:44.796622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.784672Z","title":"Simple statistical gradient-following al- gorithms for connectionist reinforcement learning,","venue":null,"work_id":"eb5844b1-0add-4984-b184-3bfa63f83266","year":1992},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.471067Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:2729be344cea8119570c6fec5f094c5468b77c713648da40b0ec83a03d433863","observation_id":"0742d209-7878-47c3-b576-dfda851ecb33","resolution":{"observed_at":"2026-08-14T06:06:44.788172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.473774Z","title":"Finding structure in time,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.473774Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:40265d10d44a9369f8b2dc1b459cb4816f9250bffd4cbad4ce84e066f2b60341","observation_id":"29169e2d-e5e2-4c8a-b759-ff6f39eb21b5","resolution":{"observed_at":"2026-08-14T06:06:44.473774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.476382Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.476382Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:459cf697b06379b67be680bb424ab5bc80a90973309515eba3c0e1bdd3c7fcb1","observation_id":"7e1e6673-c21f-4a57-af06-7ed13417c9d8","resolution":{"observed_at":"2026-08-14T06:06:44.476382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.766668Z","title":"Google’s Neural Machine Translation System: Bridging the Gap between Human and Machine Translation,","venue":null,"work_id":"20586672-ccae-422b-8f61-124333e432cd","year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.479107Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:dcd2937062dcecd8c15f7cb04c0b789e6403ad3b3ce22def9ef81549ee0ac8c7","observation_id":"be883842-f70e-4905-99ab-7376c54ef632","resolution":{"observed_at":"2026-08-14T06:06:44.769694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.757954Z","title":"Youtube2text: Recognizing and describing arbitrary ac- tivities using semantic hierarchies and zero-shot recog- nition,","venue":null,"work_id":"f8184e8d-7e16-428b-8114-643c8becf5d9","year":2013},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.483067Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:d3f28dbe20a020334073bb55c89e3a1fea516ac112a41c4a7262aff0ecb53d49","observation_id":"c9ed91e9-932d-40c4-a1b1-77058d54bb73","resolution":{"observed_at":"2026-08-14T06:06:44.761231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.749918Z","title":"Collecting highly parallel data for paraphrase evaluation,","venue":null,"work_id":"bcf0f275-37a0-4752-a87d-e316d2d86a8a","year":2011},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.485659Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:b75547bf6a0cd3b26a23db70b9ea3f47ed1ca52df87a78f1735f74ad44e05821","observation_id":"8c284eec-572c-4d33-873c-9c5288f84a8c","resolution":{"observed_at":"2026-08-14T06:06:44.752786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.740801Z","title":"MSR-VTT: A large video description dataset for bridging video and language,","venue":null,"work_id":"f615de65-c684-41fc-8612-ede77ea95a1c","year":2016},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.488668Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:0d71cb0ead3965b8e481fe4b8b99307cd7ecfddd92992b5287ad08c87a938e1d","observation_id":"ce02e931-d919-47aa-b30c-6a23d5efad9c","resolution":{"observed_at":"2026-08-14T06:06:44.744212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.491259Z","title":"Aggregated residual transformations for deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.491259Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:dcc94f4be36bb31e8392474ae01b04971b0236284732569f77703565bc077f15","observation_id":"7898fb66-7880-4e2a-b8f3-61abe7fbb891","resolution":{"observed_at":"2026-08-14T06:06:44.491259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.494009Z","title":"ECO: efﬁcient convolutional network for online video understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.494009Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:b5d61712347678889947f43eaccca86e432d2bb08a1c051608beea72148616ff","observation_id":"a15bb6f7-ae9b-42c0-893d-c2d3b4aa3292","resolution":{"observed_at":"2026-08-14T06:06:44.494009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.496761Z","title":"Sibnet: Sibling convolutional encoder for video captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.496761Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:bab96bbead4db90dd61eb960c2211a210ab2cec342ce01075b8bdfb2cf8c750e","observation_id":"19848132-ef73-4833-8e6b-cd6681b5d31a","resolution":{"observed_at":"2026-08-14T06:06:44.496761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T06:06:44.732123Z","title":"Multi-label classiﬁcation: An overview,","venue":null,"work_id":"12ef1799-cd44-47af-b14a-d109ac554f0c","year":2007},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.499410Z"},"links":{"citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:88ef013110be9781dfcd5257019bd63ed4cfe6c71742800fb3a9455a11920b13","observation_id":"ab3864ee-2408-4cb9-a5d9-f08b58e07811","resolution":{"observed_at":"2026-08-14T06:06:44.735290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-18T12:17:42.484599Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T06:06:44.395375Z","title":"Available: http://arxiv.org/abs/1409.0473","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T06:06:44.395375Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1909.00121"},"observation_digest":"sha256:b2d32eac622010195db7ee1c4df7e14941ec6e7b6d5b68dc8bc4b6d839bba440","observation_id":"59132fb8-4aa9-4310-bee9-ac53d26ba833","resolution":{"observed_at":"2026-08-14T06:06:44.395375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.00121","last_updated":"2020-07-24T08:01:29Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T00:52:06.117934Z","submitted_at":"2019-08-31T04:01:38Z","title":"A Semantics-Assisted Video Captioning Model Trained with Scheduled Sampling"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:1909.00121."}