Skip to content

Commit 8000b6f

Browse files
committed
fix formatting issue
Signed-off-by: jouw <jouw@foxmail.com>
1 parent c0c855b commit 8000b6f

2 files changed

Lines changed: 4 additions & 2 deletions

File tree

applications/DeepSpeed-Chat/dschat/rlhf/ppo_trainer.py

Lines changed: 2 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -236,7 +236,8 @@ def train_rlhf(self, inputs):
236236
value = self.critic_model.forward_value(**batch,
237237
return_value_only=True,
238238
use_cache=False)[:, :-1]
239-
critic_loss = self.critic_loss_fn(value[:, start:], old_values[:, start:],
239+
critic_loss = self.critic_loss_fn(value[:, start:], old_values[:,
240+
start:],
240241
returns, action_mask[:, start:])
241242
self.critic_model.backward(critic_loss)
242243

applications/DeepSpeed-Chat/training/step3_rlhf_finetuning/main.py

Lines changed: 2 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -594,7 +594,8 @@ def main():
594594
"-------------------------------------------------------------------------------------",
595595
args.global_rank)
596596

597-
if args.enable_tensorboard and torch.distributed.get_rank() == 0:
597+
if args.enable_tensorboard and torch.distributed.get_rank(
598+
) == 0:
598599
writer.add_scalar('reward',
599600
average_reward / inner_iter,
600601
global_step=step)

0 commit comments

Comments
 (0)