[linux-block.git] / drivers / gpu / drm / amd / amdgpu / amdgpu_job.c

/*
 * Copyright 2015 Advanced Micro Devices, Inc.
 *
 * Permission is hereby granted, free of charge, to any person obtaining a
 * copy of this software and associated documentation files (the "Software"),
 * to deal in the Software without restriction, including without limitation
 * the rights to use, copy, modify, merge, publish, distribute, sublicense,
 * and/or sell copies of the Software, and to permit persons to whom the
 * Software is furnished to do so, subject to the following conditions:
 *
 * The above copyright notice and this permission notice shall be included in
 * all copies or substantial portions of the Software.
 *
 * THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
 * IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
 * FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT.  IN NO EVENT SHALL
 * THE COPYRIGHT HOLDER(S) OR AUTHOR(S) BE LIABLE FOR ANY CLAIM, DAMAGES OR
 * OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE,
 * ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR
 * OTHER DEALINGS IN THE SOFTWARE.
 *
 *
 */
#include <linux/kthread.h>
#include <linux/wait.h>
#include <linux/sched.h>

#include <drm/drm_drv.h>

#include "amdgpu.h"
#include "amdgpu_trace.h"
#include "amdgpu_reset.h"

static enum drm_gpu_sched_stat amdgpu_job_timedout(struct drm_sched_job *s_job)
{
	struct amdgpu_ring *ring = to_amdgpu_ring(s_job->sched);
	struct amdgpu_job *job = to_amdgpu_job(s_job);
	struct amdgpu_task_info ti;
	struct amdgpu_device *adev = ring->adev;
	int idx;
	int r;

	if (!drm_dev_enter(adev_to_drm(adev), &idx)) {
		DRM_INFO("%s - device unplugged skipping recovery on scheduler:%s",
			 __func__, s_job->sched->name);

		/* Effectively the job is aborted as the device is gone */
		return DRM_GPU_SCHED_STAT_ENODEV;
	}

	memset(&ti, 0, sizeof(struct amdgpu_task_info));
	adev->job_hang = true;

	if (amdgpu_gpu_recovery &&
	    amdgpu_ring_soft_recovery(ring, job->vmid, s_job->s_fence->parent)) {
		DRM_ERROR("ring %s timeout, but soft recovered\n",
			  s_job->sched->name);
		goto exit;
	}

	amdgpu_vm_get_task_info(ring->adev, job->pasid, &ti);
	DRM_ERROR("ring %s timeout, signaled seq=%u, emitted seq=%u\n",
		  job->base.sched->name, atomic_read(&ring->fence_drv.last_seq),
		  ring->fence_drv.sync_seq);
	DRM_ERROR("Process information: process %s pid %d thread %s pid %d\n",
		  ti.process_name, ti.tgid, ti.task_name, ti.pid);

	if (amdgpu_device_should_recover_gpu(ring->adev)) {
		struct amdgpu_reset_context reset_context;
		memset(&reset_context, 0, sizeof(reset_context));

		reset_context.method = AMD_RESET_METHOD_NONE;
		reset_context.reset_req_dev = adev;
		clear_bit(AMDGPU_NEED_FULL_RESET, &reset_context.flags);

		r = amdgpu_device_gpu_recover(ring->adev, job, &reset_context);
		if (r)
			DRM_ERROR("GPU Recovery Failed: %d\n", r);
	} else {
		drm_sched_suspend_timeout(&ring->sched);
		if (amdgpu_sriov_vf(adev))
			adev->virt.tdr_debug = true;
	}

exit:
	adev->job_hang = false;
	drm_dev_exit(idx);
	return DRM_GPU_SCHED_STAT_NOMINAL;
}

int amdgpu_job_alloc(struct amdgpu_device *adev, unsigned num_ibs,
		     struct amdgpu_job **job, struct amdgpu_vm *vm)
{
	if (num_ibs == 0)
		return -EINVAL;

	*job = kzalloc(struct_size(*job, ibs, num_ibs), GFP_KERNEL);
	if (!*job)
		return -ENOMEM;

	/*
	 * Initialize the scheduler to at least some ring so that we always
	 * have a pointer to adev.
	 */
	(*job)->base.sched = &adev->rings[0]->sched;
	(*job)->vm = vm;

	amdgpu_sync_create(&(*job)->sync);
	amdgpu_sync_create(&(*job)->sched_sync);
	(*job)->vram_lost_counter = atomic_read(&adev->vram_lost_counter);
	(*job)->vm_pd_addr = AMDGPU_BO_INVALID_OFFSET;

	return 0;
}

int amdgpu_job_alloc_with_ib(struct amdgpu_device *adev, unsigned size,
		enum amdgpu_ib_pool_type pool_type,
		struct amdgpu_job **job)
{
	int r;

	r = amdgpu_job_alloc(adev, 1, job, NULL);
	if (r)
		return r;

	(*job)->num_ibs = 1;
	r = amdgpu_ib_get(adev, NULL, size, pool_type, &(*job)->ibs[0]);
	if (r)
		kfree(*job);

	return r;
}

void amdgpu_job_set_resources(struct amdgpu_job *job, struct amdgpu_bo *gds,
			      struct amdgpu_bo *gws, struct amdgpu_bo *oa)
{
	if (gds) {
		job->gds_base = amdgpu_bo_gpu_offset(gds) >> PAGE_SHIFT;
		job->gds_size = amdgpu_bo_size(gds) >> PAGE_SHIFT;
	}
	if (gws) {
		job->gws_base = amdgpu_bo_gpu_offset(gws) >> PAGE_SHIFT;
		job->gws_size = amdgpu_bo_size(gws) >> PAGE_SHIFT;
	}
	if (oa) {
		job->oa_base = amdgpu_bo_gpu_offset(oa) >> PAGE_SHIFT;
		job->oa_size = amdgpu_bo_size(oa) >> PAGE_SHIFT;
	}
}

void amdgpu_job_free_resources(struct amdgpu_job *job)
{
	struct amdgpu_ring *ring = to_amdgpu_ring(job->base.sched);
	struct dma_fence *f;
	unsigned i;

	/* use sched fence if available */
	f = job->base.s_fence ? &job->base.s_fence->finished :  &job->hw_fence;
	for (i = 0; i < job->num_ibs; ++i)
		amdgpu_ib_free(ring->adev, &job->ibs[i], f);
}

static void amdgpu_job_free_cb(struct drm_sched_job *s_job)
{
	struct amdgpu_job *job = to_amdgpu_job(s_job);

	drm_sched_job_cleanup(s_job);

	amdgpu_sync_free(&job->sync);
	amdgpu_sync_free(&job->sched_sync);

	dma_fence_put(&job->hw_fence);
}

void amdgpu_job_set_gang_leader(struct amdgpu_job *job,
				struct amdgpu_job *leader)
{
	struct dma_fence *fence = &leader->base.s_fence->scheduled;

	WARN_ON(job->gang_submit);

	/*
	 * Don't add a reference when we are the gang leader to avoid circle
	 * dependency.
	 */
	if (job != leader)
		dma_fence_get(fence);
	job->gang_submit = fence;
}

void amdgpu_job_free(struct amdgpu_job *job)
{
	amdgpu_job_free_resources(job);
	amdgpu_sync_free(&job->sync);
	amdgpu_sync_free(&job->sched_sync);
	if (job->gang_submit != &job->base.s_fence->scheduled)
		dma_fence_put(job->gang_submit);

	if (!job->hw_fence.ops)
		kfree(job);
	else
		dma_fence_put(&job->hw_fence);
}

int amdgpu_job_submit(struct amdgpu_job *job, struct drm_sched_entity *entity,
		      void *owner, struct dma_fence **f)
{
	int r;

	if (!f)
		return -EINVAL;

	r = drm_sched_job_init(&job->base, entity, owner);
	if (r)
		return r;

	drm_sched_job_arm(&job->base);

	*f = dma_fence_get(&job->base.s_fence->finished);
	amdgpu_job_free_resources(job);
	drm_sched_entity_push_job(&job->base);

	return 0;
}

int amdgpu_job_submit_direct(struct amdgpu_job *job, struct amdgpu_ring *ring,
			     struct dma_fence **fence)
{
	int r;

	job->base.sched = &ring->sched;
	r = amdgpu_ib_schedule(ring, job->num_ibs, job->ibs, job, fence);

	if (r)
		return r;

	amdgpu_job_free(job);
	return 0;
}

static struct dma_fence *amdgpu_job_dependency(struct drm_sched_job *sched_job,
					       struct drm_sched_entity *s_entity)
{
	struct amdgpu_ring *ring = to_amdgpu_ring(s_entity->rq->sched);
	struct amdgpu_job *job = to_amdgpu_job(sched_job);
	struct amdgpu_vm *vm = job->vm;
	struct dma_fence *fence;
	int r;

	fence = amdgpu_sync_get_fence(&job->sync);
	if (fence && drm_sched_dependency_optimized(fence, s_entity)) {
		r = amdgpu_sync_fence(&job->sched_sync, fence);
		if (r)
			DRM_ERROR("Error adding fence (%d)\n", r);
	}

	while (fence == NULL && vm && !job->vmid) {
		r = amdgpu_vmid_grab(vm, ring, &job->sync,
				     &job->base.s_fence->finished,
				     job);
		if (r)
			DRM_ERROR("Error getting VM ID (%d)\n", r);

		fence = amdgpu_sync_get_fence(&job->sync);
	}

	if (!fence && job->gang_submit)
		fence = amdgpu_device_switch_gang(ring->adev, job->gang_submit);

	return fence;
}

static struct dma_fence *amdgpu_job_run(struct drm_sched_job *sched_job)
{
	struct amdgpu_ring *ring = to_amdgpu_ring(sched_job->sched);
	struct amdgpu_device *adev = ring->adev;
	struct dma_fence *fence = NULL, *finished;
	struct amdgpu_job *job;
	int r = 0;

	job = to_amdgpu_job(sched_job);
	finished = &job->base.s_fence->finished;

	BUG_ON(amdgpu_sync_peek_fence(&job->sync, NULL));

	trace_amdgpu_sched_run_job(job);

	/* Skip job if VRAM is lost and never resubmit gangs */
	if (job->vram_lost_counter != atomic_read(&adev->vram_lost_counter) ||
	    (job->job_run_counter && job->gang_submit))
		dma_fence_set_error(finished, -ECANCELED);

	if (finished->error < 0) {
		DRM_INFO("Skip scheduling IBs!\n");
	} else {
		r = amdgpu_ib_schedule(ring, job->num_ibs, job->ibs, job,
				       &fence);
		if (r)
			DRM_ERROR("Error scheduling IBs (%d)\n", r);
	}

	job->job_run_counter++;
	amdgpu_job_free_resources(job);

	fence = r ? ERR_PTR(r) : fence;
	return fence;
}

#define to_drm_sched_job(sched_job)		\
		container_of((sched_job), struct drm_sched_job, queue_node)

void amdgpu_job_stop_all_jobs_on_sched(struct drm_gpu_scheduler *sched)
{
	struct drm_sched_job *s_job;
	struct drm_sched_entity *s_entity = NULL;
	int i;

	/* Signal all jobs not yet scheduled */
	for (i = DRM_SCHED_PRIORITY_COUNT - 1; i >= DRM_SCHED_PRIORITY_MIN; i--) {
		struct drm_sched_rq *rq = &sched->sched_rq[i];
		spin_lock(&rq->lock);
		list_for_each_entry(s_entity, &rq->entities, list) {
			while ((s_job = to_drm_sched_job(spsc_queue_pop(&s_entity->job_queue)))) {
				struct drm_sched_fence *s_fence = s_job->s_fence;

				dma_fence_signal(&s_fence->scheduled);
				dma_fence_set_error(&s_fence->finished, -EHWPOISON);
				dma_fence_signal(&s_fence->finished);
			}
		}
		spin_unlock(&rq->lock);
	}

	/* Signal all jobs already scheduled to HW */
	list_for_each_entry(s_job, &sched->pending_list, list) {
		struct drm_sched_fence *s_fence = s_job->s_fence;

		dma_fence_set_error(&s_fence->finished, -EHWPOISON);
		dma_fence_signal(&s_fence->finished);
	}
}

const struct drm_sched_backend_ops amdgpu_sched_ops = {
	.dependency = amdgpu_job_dependency,
	.run_job = amdgpu_job_run,
	.timedout_job = amdgpu_job_timedout,
	.free_job = amdgpu_job_free_cb
};
Commit	Line	Data
c1b69ed0 CZ	1	/*
	2	* Copyright 2015 Advanced Micro Devices, Inc.
	3	*
	4	* Permission is hereby granted, free of charge, to any person obtaining a
	5	* copy of this software and associated documentation files (the "Software"),
	6	* to deal in the Software without restriction, including without limitation
	7	* the rights to use, copy, modify, merge, publish, distribute, sublicense,
	8	* and/or sell copies of the Software, and to permit persons to whom the
	9	* Software is furnished to do so, subject to the following conditions:
	10	*
	11	* The above copyright notice and this permission notice shall be included in
	12	* all copies or substantial portions of the Software.
	13	*
	14	* THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
	15	* IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
	16	* FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL
	17	* THE COPYRIGHT HOLDER(S) OR AUTHOR(S) BE LIABLE FOR ANY CLAIM, DAMAGES OR
	18	* OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE,
	19	* ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR
	20	* OTHER DEALINGS IN THE SOFTWARE.
	21	*
	22	*
	23	*/
	24	#include <linux/kthread.h>
	25	#include <linux/wait.h>
	26	#include <linux/sched.h>
fdf2f6c5	27
ca4e1724 AG	28	#include <drm/drm_drv.h>
ca4e1724 AG	29
c1b69ed0	30	#include "amdgpu.h"
7034decf	31	#include "amdgpu_trace.h"
f1549c09	32	#include "amdgpu_reset.h"
c1b69ed0	33
a6a1f036	34	static enum drm_gpu_sched_stat amdgpu_job_timedout(struct drm_sched_job *s_job)
0de2479c	35	{
3320b8d2 CK	36	struct amdgpu_ring *ring = to_amdgpu_ring(s_job->sched);
3320b8d2 CK	37	struct amdgpu_job *job = to_amdgpu_job(s_job);
0346bfd9	38	struct amdgpu_task_info ti;
95a2f917	39	struct amdgpu_device *adev = ring->adev;
ca4e1724	40	int idx;
7258fa31	41	int r;
ca4e1724	42
c58a863b	43	if (!drm_dev_enter(adev_to_drm(adev), &idx)) {
ca4e1724 AG	44	DRM_INFO("%s - device unplugged skipping recovery on scheduler:%s",
	45	__func__, s_job->sched->name);
	46
	47	/* Effectively the job is aborted as the device is gone */
	48	return DRM_GPU_SCHED_STAT_ENODEV;
	49	}
0346bfd9 TH	50
0346bfd9 TH	51	memset(&ti, 0, sizeof(struct amdgpu_task_info));
194eb174	52	adev->job_hang = true;
0e51a772	53
cc063ea2 MO	54	if (amdgpu_gpu_recovery &&
cc063ea2 MO	55	amdgpu_ring_soft_recovery(ring, job->vmid, s_job->s_fence->parent)) {
7876fa4f CK	56	DRM_ERROR("ring %s timeout, but soft recovered\n",
7876fa4f CK	57	s_job->sched->name);
ca4e1724	58	goto exit;
7876fa4f CK	59	}
7876fa4f CK	60
0346bfd9	61	amdgpu_vm_get_task_info(ring->adev, job->pasid, &ti);
f024e883	62	DRM_ERROR("ring %s timeout, signaled seq=%u, emitted seq=%u\n",
3320b8d2 CK	63	job->base.sched->name, atomic_read(&ring->fence_drv.last_seq),
3320b8d2 CK	64	ring->fence_drv.sync_seq);
0346bfd9 TH	65	DRM_ERROR("Process information: process %s pid %d thread %s pid %d\n",
0346bfd9 TH	66	ti.process_name, ti.tgid, ti.task_name, ti.pid);
4fbf87e2	67
95a2f917	68	if (amdgpu_device_should_recover_gpu(ring->adev)) {
f1549c09 LG	69	struct amdgpu_reset_context reset_context;
	70	memset(&reset_context, 0, sizeof(reset_context));
	71
	72	reset_context.method = AMD_RESET_METHOD_NONE;
	73	reset_context.reset_req_dev = adev;
	74	clear_bit(AMDGPU_NEED_FULL_RESET, &reset_context.flags);
	75
	76	r = amdgpu_device_gpu_recover(ring->adev, job, &reset_context);
7258fa31 SK	77	if (r)
7258fa31 SK	78	DRM_ERROR("GPU Recovery Failed: %d\n", r);
95a2f917	79	} else {
c3b6c607	80	drm_sched_suspend_timeout(&ring->sched);
95a2f917 YT	81	if (amdgpu_sriov_vf(adev))
	82	adev->virt.tdr_debug = true;
	83	}
ca4e1724 AG	84
ca4e1724 AG	85	exit:
194eb174	86	adev->job_hang = false;
ca4e1724 AG	87	drm_dev_exit(idx);
ca4e1724 AG	88	return DRM_GPU_SCHED_STAT_NOMINAL;
0de2479c ML	89	}
0de2479c ML	90
50838c8c	91	int amdgpu_job_alloc(struct amdgpu_device *adev, unsigned num_ibs,
c5637837	92	struct amdgpu_job *job, struct amdgpu_vm vm)
50838c8c	93	{
50838c8c CK	94	if (num_ibs == 0)
	95	return -EINVAL;
	96
6103b2f2	97	job = kzalloc(struct_size(job, ibs, num_ibs), GFP_KERNEL);
50838c8c CK	98	if (!*job)
	99	return -ENOMEM;
	100
a1917b73 CK	101	/*
	102	* Initialize the scheduler to at least some ring so that we always
	103	* have a pointer to adev.
	104	*/
	105	(*job)->base.sched = &adev->rings[0]->sched;
c5637837	106	(*job)->vm = vm;
50838c8c	107
e86f9cee	108	amdgpu_sync_create(&(*job)->sync);
df83d1eb	109	amdgpu_sync_create(&(*job)->sched_sync);
c70b78a7	110	(*job)->vram_lost_counter = atomic_read(&adev->vram_lost_counter);
d8de8260	111	(*job)->vm_pd_addr = AMDGPU_BO_INVALID_OFFSET;
e86f9cee	112
50838c8c CK	113	return 0;
	114	}
	115
d71518b5	116	int amdgpu_job_alloc_with_ib(struct amdgpu_device *adev, unsigned size,
c8e42d57	117	enum amdgpu_ib_pool_type pool_type,
c8e42d57	118	struct amdgpu_job **job)
d71518b5 CK	119	{
	120	int r;
	121
c5637837	122	r = amdgpu_job_alloc(adev, 1, job, NULL);
d71518b5 CK	123	if (r)
	124	return r;
	125
4624459c	126	(*job)->num_ibs = 1;
c8e42d57	127	r = amdgpu_ib_get(adev, NULL, size, pool_type, &(*job)->ibs[0]);
d71518b5 CK	128	if (r)
	129	kfree(*job);
	130
	131	return r;
	132	}
	133
736ec9fa CK	134	void amdgpu_job_set_resources(struct amdgpu_job job, struct amdgpu_bo gds,
	135	struct amdgpu_bo gws, struct amdgpu_bo oa)
	136	{
	137	if (gds) {
	138	job->gds_base = amdgpu_bo_gpu_offset(gds) >> PAGE_SHIFT;
	139	job->gds_size = amdgpu_bo_size(gds) >> PAGE_SHIFT;
	140	}
	141	if (gws) {
	142	job->gws_base = amdgpu_bo_gpu_offset(gws) >> PAGE_SHIFT;
	143	job->gws_size = amdgpu_bo_size(gws) >> PAGE_SHIFT;
	144	}
	145	if (oa) {
	146	job->oa_base = amdgpu_bo_gpu_offset(oa) >> PAGE_SHIFT;
	147	job->oa_size = amdgpu_bo_size(oa) >> PAGE_SHIFT;
	148	}
	149	}
	150
a5fb4ec2	151	void amdgpu_job_free_resources(struct amdgpu_job *job)
50838c8c	152	{
a1917b73	153	struct amdgpu_ring *ring = to_amdgpu_ring(job->base.sched);
f54d1867	154	struct dma_fence *f;
1ab0d211 CK	155	unsigned i;
1ab0d211 CK	156
c530b02f	157	/* use sched fence if available */
f6a3f660	158	f = job->base.s_fence ? &job->base.s_fence->finished : &job->hw_fence;
50838c8c	159	for (i = 0; i < job->num_ibs; ++i)
a1917b73	160	amdgpu_ib_free(ring->adev, &job->ibs[i], f);
d71518b5 CK	161	}
d71518b5 CK	162
1b1f42d8	163	static void amdgpu_job_free_cb(struct drm_sched_job *s_job)
b6723c8d	164	{
3320b8d2	165	struct amdgpu_job *job = to_amdgpu_job(s_job);
c5f74f78	166
26efecf9 SM	167	drm_sched_job_cleanup(s_job);
26efecf9 SM	168
a79a5bdc	169	amdgpu_sync_free(&job->sync);
df83d1eb	170	amdgpu_sync_free(&job->sched_sync);
c530b02f	171
f6a3f660	172	dma_fence_put(&job->hw_fence);
b6723c8d ML	173	}
b6723c8d ML	174
68ce8b24 CK	175	void amdgpu_job_set_gang_leader(struct amdgpu_job *job,
	176	struct amdgpu_job *leader)
	177	{
	178	struct dma_fence *fence = &leader->base.s_fence->scheduled;
	179
	180	WARN_ON(job->gang_submit);
	181
	182	/*
	183	* Don't add a reference when we are the gang leader to avoid circle
	184	* dependency.
	185	*/
	186	if (job != leader)
	187	dma_fence_get(fence);
	188	job->gang_submit = fence;
	189	}
	190
1e24e31f CK	191	void amdgpu_job_free(struct amdgpu_job *job)
	192	{
	193	amdgpu_job_free_resources(job);
a79a5bdc	194	amdgpu_sync_free(&job->sync);
df83d1eb	195	amdgpu_sync_free(&job->sched_sync);
68ce8b24 CK	196	if (job->gang_submit != &job->base.s_fence->scheduled)
68ce8b24 CK	197	dma_fence_put(job->gang_submit);
c530b02f	198
2581c5d8 YW	199	if (!job->hw_fence.ops)
	200	kfree(job);
	201	else
	202	dma_fence_put(&job->hw_fence);
1e24e31f CK	203	}
1e24e31f CK	204
0e28b10f CK	205	int amdgpu_job_submit(struct amdgpu_job job, struct drm_sched_entity entity,
0e28b10f CK	206	void owner, struct dma_fence *f)
d71518b5	207	{
e686941a	208	int r;
d71518b5	209
e686941a ML	210	if (!f)
	211	return -EINVAL;
	212
cdc50176	213	r = drm_sched_job_init(&job->base, entity, owner);
e686941a ML	214	if (r)
e686941a ML	215	return r;
d71518b5	216
dbe48d03 DV	217	drm_sched_job_arm(&job->base);
dbe48d03 DV	218
f54d1867	219	*f = dma_fence_get(&job->base.s_fence->finished);
a5fb4ec2	220	amdgpu_job_free_resources(job);
0e10e9a1	221	drm_sched_entity_push_job(&job->base);
d71518b5 CK	222
d71518b5 CK	223	return 0;
50838c8c CK	224	}
50838c8c CK	225
ee913fd9 CK	226	int amdgpu_job_submit_direct(struct amdgpu_job job, struct amdgpu_ring ring,
	227	struct dma_fence **fence)
	228	{
	229	int r;
	230
	231	job->base.sched = &ring->sched;
f6a3f660 AG	232	r = amdgpu_ib_schedule(ring, job->num_ibs, job->ibs, job, fence);
f6a3f660 AG	233
ee913fd9 CK	234	if (r)
	235	return r;
	236
	237	amdgpu_job_free(job);
	238	return 0;
	239	}
	240
1b1f42d8 LS	241	static struct dma_fence amdgpu_job_dependency(struct drm_sched_job sched_job,
1b1f42d8 LS	242	struct drm_sched_entity *s_entity)
e61235db	243	{
068c3304	244	struct amdgpu_ring *ring = to_amdgpu_ring(s_entity->rq->sched);
a6db8a33	245	struct amdgpu_job *job = to_amdgpu_job(sched_job);
c5637837	246	struct amdgpu_vm *vm = job->vm;
f024e883	247	struct dma_fence *fence;
df83d1eb	248	int r;
cebb52b7	249
174b328b CK	250	fence = amdgpu_sync_get_fence(&job->sync);
	251	if (fence && drm_sched_dependency_optimized(fence, s_entity)) {
	252	r = amdgpu_sync_fence(&job->sched_sync, fence);
	253	if (r)
	254	DRM_ERROR("Error adding fence (%d)\n", r);
a340c7bc	255	}
cebb52b7	256
c4f46f22	257	while (fence == NULL && vm && !job->vmid) {
620f774f CK	258	r = amdgpu_vmid_grab(vm, ring, &job->sync,
	259	&job->base.s_fence->finished,
	260	job);
94dd0a4a	261	if (r)
8d0a7cea	262	DRM_ERROR("Error getting VM ID (%d)\n", r);
8d0a7cea	263
174b328b	264	fence = amdgpu_sync_get_fence(&job->sync);
8d0a7cea CK	265	}
8d0a7cea CK	266
68ce8b24 CK	267	if (!fence && job->gang_submit)
	268	fence = amdgpu_device_switch_gang(ring->adev, job->gang_submit);
	269
8d0a7cea	270	return fence;
e61235db CK	271	}
e61235db CK	272
1b1f42d8	273	static struct dma_fence amdgpu_job_run(struct drm_sched_job sched_job)
c1b69ed0	274	{
3320b8d2	275	struct amdgpu_ring *ring = to_amdgpu_ring(sched_job->sched);
68ce8b24	276	struct amdgpu_device *adev = ring->adev;
48f05f29	277	struct dma_fence fence = NULL, finished;
4c7eb91c	278	struct amdgpu_job *job;
db5e65fc	279	int r = 0;
c1b69ed0	280
a6db8a33	281	job = to_amdgpu_job(sched_job);
48f05f29	282	finished = &job->base.s_fence->finished;
e86f9cee	283
1fbb2e92	284	BUG_ON(amdgpu_sync_peek_fence(&job->sync, NULL));
e86f9cee	285
7034decf	286	trace_amdgpu_sched_run_job(job);
48f05f29	287
68ce8b24 CK	288	/* Skip job if VRAM is lost and never resubmit gangs */
	289	if (job->vram_lost_counter != atomic_read(&adev->vram_lost_counter) \|\|
	290	(job->job_run_counter && job->gang_submit))
	291	dma_fence_set_error(finished, -ECANCELED);
f1403342 CK	292
	293	if (finished->error < 0) {
	294	DRM_INFO("Skip scheduling IBs!\n");
	295	} else {
3320b8d2	296	r = amdgpu_ib_schedule(ring, job->num_ibs, job->ibs, job,
f1403342	297	&fence);
15d73ce6 CZ	298	if (r)
	299	DRM_ERROR("Error scheduling IBs (%d)\n", r);
	300	}
b2ff0e8a	301
c530b02f	302	job->job_run_counter++;
22a77cf6	303	amdgpu_job_free_resources(job);
db5e65fc AG	304
db5e65fc AG	305	fence = r ? ERR_PTR(r) : fence;
ec72b800	306	return fence;
c1b69ed0 CZ	307	}
c1b69ed0 CZ	308
7c6e68c7 AG	309	#define to_drm_sched_job(sched_job) \
	310	container_of((sched_job), struct drm_sched_job, queue_node)
	311
	312	void amdgpu_job_stop_all_jobs_on_sched(struct drm_gpu_scheduler *sched)
	313	{
	314	struct drm_sched_job *s_job;
	315	struct drm_sched_entity *s_entity = NULL;
	316	int i;
	317
	318	/* Signal all jobs not yet scheduled */
e2d732fd	319	for (i = DRM_SCHED_PRIORITY_COUNT - 1; i >= DRM_SCHED_PRIORITY_MIN; i--) {
7c6e68c7	320	struct drm_sched_rq *rq = &sched->sched_rq[i];
7c6e68c7 AG	321	spin_lock(&rq->lock);
	322	list_for_each_entry(s_entity, &rq->entities, list) {
	323	while ((s_job = to_drm_sched_job(spsc_queue_pop(&s_entity->job_queue)))) {
	324	struct drm_sched_fence *s_fence = s_job->s_fence;
	325
	326	dma_fence_signal(&s_fence->scheduled);
	327	dma_fence_set_error(&s_fence->finished, -EHWPOISON);
	328	dma_fence_signal(&s_fence->finished);
	329	}
	330	}
	331	spin_unlock(&rq->lock);
	332	}
	333
	334	/* Signal all jobs already scheduled to HW */
6efa4b46	335	list_for_each_entry(s_job, &sched->pending_list, list) {
7c6e68c7 AG	336	struct drm_sched_fence *s_fence = s_job->s_fence;
	337
	338	dma_fence_set_error(&s_fence->finished, -EHWPOISON);
	339	dma_fence_signal(&s_fence->finished);
	340	}
	341	}
	342
1b1f42d8	343	const struct drm_sched_backend_ops amdgpu_sched_ops = {
0856cab1 CK	344	.dependency = amdgpu_job_dependency,
0856cab1 CK	345	.run_job = amdgpu_job_run,
0e51a772	346	.timedout_job = amdgpu_job_timedout,
c5f74f78	347	.free_job = amdgpu_job_free_cb
c1b69ed0	348	};